一个拥有 2890 万参数的语言模型已成功在售价 8 美元的 ESP32-S3 微控制器上运行,速度约为每秒 9 个 token。这一重大进展得益于借鉴了 Google Gemma 模型中的逐层嵌入(Per-Layer Embeddings)概念,使得模型的大部分参数可以驻留在速度较慢的闪存中,而不是快速的 RAM 中。该模型在 TinyStories 数据集上进行了训练,能够生成简短连贯的故事,但由于其推理核心的限制,缺乏指令遵循或事实回忆能力。 AI
影响 证明了在低功耗边缘设备上运行更大参数大语言模型的可能性,可能为新的设备端 AI 应用带来机遇。
排序理由 将现有大语言模型技术新颖地应用于极其受限的硬件。
在 Hacker News — AI stories ≥50 points 阅读 →
- esp32-ai
- slvDev
- Andrej Karpathy
- ESP32-S3
- Gemma
- llama2.c
- Microsoft Research
- Ronen Eldan
- TinyStories
- Yuanzhi Li
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →