一种名为 Flash-MoE 的新技术允许一个拥有 3970 亿参数的庞大模型 Qwen3.5-397B-A17B 在只有 48GB RAM 的 MacBook Pro 等消费级硬件上运行。这是通过利用专家混合(MoE)架构实现的,其中每个 token 只激活模型参数的一小部分,其余参数可以从 SSD 流式传输。这种方法受到一篇先前未发布的 Apple 论文的启发,显著减小了内存占用,尽管与基于云的解决方案相比,推理速度较慢。 AI
影响 能够在消费级硬件上运行大型模型,尽管速度较慢,但可能扩展本地 AI 的使用场景。
排序理由 展示了一种运行大型模型在消费级硬件上的新颖技术,该技术受到了先前研究论文的启发。
- Apple Inc.
- CVS Health
- Dan Woods
- Flash MoE
- GitHub
- Hacker News
- LLM in a Flash: Efficient Large Language Model Inference with Limited Memory
- MacBook Pro M3 Max
- Qwen3.5-397B-A17B
- r/LocalLLaMA
- Several-Tax31
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →