3 min read
[AI 小众新闻]

仅需8美元的廉价芯片驱动28.9M LLM,谷歌技术"Per-Layer Embeddings"带来百倍进化


使用仅8美元的ESP32-S3微控制器,完全离线运行28.9M参数的语言模型(LLM)。将谷歌的Gemma 3n/4技术移植到微控制器上。

※この記事はアフィリエイト広告を含みます

仅需8美元的廉价芯片驱动28.9M LLM,谷歌技术“Per-Layer Embeddings”带来百倍进化

发生了什么?新闻概述

  • 廉价芯片上的LLM运行: 在仅8美元的微控制器“ESP32-S3”上成功运行28.9M参数的语言模型(LLM)。
  • 惊人的参数增长: 该技术突破了传统同类芯片的记录(260k),实现了100倍以上的进化,并通过4bit量子化将其轻量化至14.9MB。
  • 完全离线操作: 完全不依赖外部服务器,设备本身以每秒约9.5个标记的速度生成文本(故事),并输出到连接的屏幕上。

为什么这很重要?值得关注的要点

  • 突破内存限制: 该芯片原本只有512KB的极小SRAM,通过应用谷歌的“Gemma 3n”和“Gemma 4”中的“Per-Layer Embeddings”技术,将模型的大部分放置在低速的Flash内存中,从而实现了运行。
  • 高效的数据访问: 在推理时并非读取整个Flash,而是每次仅取样必要的几行(约450字节),有效避免内存不足的问题。

🦈 鲨鱼的视角(策展人的视点)

这条新闻的精彩之处,不仅仅在于“在小芯片上运行AI”这一层面!将最新的Gemma模型所采用的“Per-Layer Embeddings”架构,成功移植到仅8美元的微控制器的内存布局中,其实现能力令人震惊。过去,这类微控制器必须在“推理的核心部分能容纳SRAM的大小”内,参数限制在约260k。然而,通过将模型的权重大部分存储在Flash这个“巨大的仓库”中,并在需要时按需提取,这一技术将参数扩展到了2890万,无疑是边缘AI的革命!

虽然由于使用TinyStories数据集进行训练,生成的故事限制在简单范畴,但这种“在小型硬件上运行巨大模型”的设计理念,正是未来分布式AI时代的象征!

未来将如何发展?

随着这一方法的确立,未来将能够将“虽然不聪明但专注于特定任务的巨大模型”嵌入到各种家电和廉价小工具中。可以预见,注重隐私的无需云服务的设备将会大幅增加!

鲨鱼视角的一句话

如果8美元的芯片可以编织故事,那我想在海洋中的每一个浮标上都放置一个AI,记录所有鲨鱼之间的对话!鲨鱼鲨鱼!🦈🔥

术语解说

  • ESP32-S3: 一款低成本且低功耗的微控制器,具备Wi-Fi/Bluetooth功能,在DIY和物联网开发中广受欢迎。

  • Per-Layer Embeddings: 谷歌Gemma系列采用的高效管理模型权重数据的技术,适用于在有限计算资源下处理巨大模型。

  • 4-bit量子化: 通过降低AI模型的数值精度,显著减少计算负担和内存使用量。这使得模型尺寸减少至一半以下。

  • 信息来源: Running a 28.9M parameter LLM on an $8 microcontroller

【免責事項 / Disclaimer / 免責聲明】
JP: 本記事はAIによって構成され、運営者が内容の確認・管理を行っています。情報の正確性は保証せず、外部サイトのコンテンツには一切の責任を負いません。
EN: This article was structured by AI and is verified and managed by the operator. Accuracy is not guaranteed, and we assume no responsibility for external content.
ZH: 本文由AI構建,並由運營者進行內容確認與管理。不保證準確性,也不對外部網站的內容承擔任何責任。
🦈