一位开发者创建了一个名为 Picchio 的 C 语言推理引擎,允许大型专家混合(MoE)模型在内存小于模型大小的系统上运行,方法是从磁盘流式传输专家。该项目最近增加了对 MiniMax-M2 模型(转换为 INT4 后约 122 GB)的支持。该设置在配备 32 GB RAM 和 NVMe SSD 的 12 核笔记本电脑上实现了约 0.48 tokens/秒的性能,证明了缓存大小是性能的关键因素。 AI
影响 使得在消费级硬件上运行大型 AI 模型成为可能,从而可能降低 AI 实验的门槛。
排序理由 该集群描述了一个新的推理引擎,它使得现有模型能在较少硬件上运行,而不是一个新的模型发布或研究突破。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →