一款名为 TurboFieldfare 的开源推理引擎已被开发出来,可在内存仅为 2GB 的 Apple Silicon Mac 上运行 Google 的 Gemma 4 26B 大型语言模型。这是通过动态层激活、自适应量化和优化内存映射等技术实现的,大大降低了通常与 LLM 相关的内存要求。该项目可在 GitHub 上找到,展示了令人印象深刻的性能,一个 26B 参数的模型在 8GB M2 MacBook Air 上每秒可生成 12-15 个 token,从而使先进的 AI 功能更易于访问和保护隐私。 AI
影响 通过在消费级硬件上实现本地、私密推理,使先进 LLM 的访问民主化,可能加速离线优先的 AI 应用开发。
排序理由 该项目描述了一个工具,该工具能够在内存要求显著降低的情况下在消费级硬件上运行现有的 LLM,而不是发布新模型或核心研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →