3 min read
[AI 小众新闻]

在"分布式"环境下运行巨型LLM!BitTorrent方式的推理网络『Petals』实在太酷了!


利用家中的GPU或Google Colab,网络参与者共同协作运行像Llama 3.1 (405B)这样超大型模型的分布式平台。

※この記事はアフィリエイト広告を含みます

在“分布式”环境下运行巨型LLM!BitTorrent方式的推理网络『Petals』实在太酷了!

发生了什么?新闻概览

  • BitTorrent方式的分布式网络: 可以将模型的一部分加载到本地,并与其他拥有不同部分的用户合作运行Llama 3.1 (405B)和Mixtral (8x22B)等巨型LLM。
  • 可在消费级GPU上运行: 即使没有昂贵的服务器用GPU,也可以在家用GPU或Google Colab中进行超大型模型的推理和微调。
  • 实用的推理速度: 在Llama 2 (70B)上可达到最高6 tokens/sec,Falcon (180B)上可达到最高4 tokens/sec,足以满足聊天机器人和交互式应用的需求。

为什么这很重要?值得关注的亮点

  • API的便利性与PyTorch的灵活性的结合: 与单一的API使用不同,用户可以自由访问隐藏状态(hidden states)、执行自定义路径以及应用独特的采样方法。
  • 突破“内存瓶颈”: 通过在整个网络中分布存储无法容纳在单一GPU内的400B级模型,使得个人用户也能轻松处理。
  • 对研究者和开发者的开放: 作为BigScience研究工作坊的一部分开发,用户可以深入访问模型的内部结构,从而促进高级研究和定制。

🦈 鲨鱼眼(策展人视角)

分布式推理的时代终于来临了!Llama 3.1的405B模型,通常需要多张H100才能运行,而现在通过“大家共同出力”的BitTorrent方式来解决,简直太酷了!尤其令人惊叹的是,它不仅仅是输出文本,还可以查看“隐藏状态”或调整“特定路径”。这意味着开发者可以在自己的机器上自由改造,解剖那些曾经被视为黑箱的巨大模型,不再受限于现有的API限制,直接将PyTorch的灵活性应用到超大型模型上,堪称“AI民主化”的巅峰!

未来会怎样?

如果这个网络不断扩大,未来更多巨型模型将以“理所当然”的方式进行微调和运作。依靠社区而非中央集权的大企业,推动AI运作的生态系统将加速发展!

春鲨一语

把我们的GPU集合起来,黑客出巨大的智能!加入网络,与全世界的鲨鱼们一起驯化巨型LLM吧!🦈🔥

术语解释

  • 分布式推理: 将一个巨型AI模型进行分割,并在多台计算机上分担计算的技术。

  • 隐藏状态 (Hidden States): 模型内部计算过程中生成的数据。通过观察这些数据,可以深入分析AI的思维过程。

  • 微调: 对已有的学习模型进行针对特定任务或数据的附加学习和优化。

  • 信息来源: Petals: Run LLMs at home, BitTorrent-style

🦈 はるサメ厳選!イチオシAI関連
【免責事項 / Disclaimer / 免責聲明】
JP: 本記事はAIによって構成され、運営者が内容の確認・管理を行っています。情報の正確性は保証せず、外部サイトのコンテンツには一切の責任を負いません。
EN: This article was structured by AI and is verified and managed by the operator. Accuracy is not guaranteed, and we assume no responsibility for external content.
ZH: 本文由AI構建,並由運營者進行內容確認與管理。不保證準確性,也不對外部網站的內容承擔任何責任。
🦈