※この記事はアフィリエイト広告を含みます
在“分布式”环境下运行巨型LLM!BitTorrent方式的推理网络『Petals』实在太酷了!
发生了什么?新闻概览
- BitTorrent方式的分布式网络: 可以将模型的一部分加载到本地,并与其他拥有不同部分的用户合作运行Llama 3.1 (405B)和Mixtral (8x22B)等巨型LLM。
- 可在消费级GPU上运行: 即使没有昂贵的服务器用GPU,也可以在家用GPU或Google Colab中进行超大型模型的推理和微调。
- 实用的推理速度: 在Llama 2 (70B)上可达到最高6 tokens/sec,Falcon (180B)上可达到最高4 tokens/sec,足以满足聊天机器人和交互式应用的需求。
为什么这很重要?值得关注的亮点
- API的便利性与PyTorch的灵活性的结合: 与单一的API使用不同,用户可以自由访问隐藏状态(hidden states)、执行自定义路径以及应用独特的采样方法。
- 突破“内存瓶颈”: 通过在整个网络中分布存储无法容纳在单一GPU内的400B级模型,使得个人用户也能轻松处理。
- 对研究者和开发者的开放: 作为BigScience研究工作坊的一部分开发,用户可以深入访问模型的内部结构,从而促进高级研究和定制。
🦈 鲨鱼眼(策展人视角)
分布式推理的时代终于来临了!Llama 3.1的405B模型,通常需要多张H100才能运行,而现在通过“大家共同出力”的BitTorrent方式来解决,简直太酷了!尤其令人惊叹的是,它不仅仅是输出文本,还可以查看“隐藏状态”或调整“特定路径”。这意味着开发者可以在自己的机器上自由改造,解剖那些曾经被视为黑箱的巨大模型,不再受限于现有的API限制,直接将PyTorch的灵活性应用到超大型模型上,堪称“AI民主化”的巅峰!
未来会怎样?
如果这个网络不断扩大,未来更多巨型模型将以“理所当然”的方式进行微调和运作。依靠社区而非中央集权的大企业,推动AI运作的生态系统将加速发展!
春鲨一语
把我们的GPU集合起来,黑客出巨大的智能!加入网络,与全世界的鲨鱼们一起驯化巨型LLM吧!🦈🔥
术语解释
-
分布式推理: 将一个巨型AI模型进行分割,并在多台计算机上分担计算的技术。
-
隐藏状态 (Hidden States): 模型内部计算过程中生成的数据。通过观察这些数据,可以深入分析AI的思维过程。
-
微调: 对已有的学习模型进行针对特定任务或数据的附加学习和优化。