一个名为 WASTE 的新的基于 C 的推理引擎已被开发出来,用于运行大型语言模型,特别是 2.78 万亿参数的 Kimi k3 模型,通过直接从 NVMe 存储流式传输激活的权重。这种方法允许模型通过利用磁盘作为扩展内存来运行超出可用 RAM 的限制。该引擎被设计为无依赖且可嵌入的,将核心模型保留在内存中,同时有效地管理来自磁盘的专家权重。 AI
影响 使得在 RAM 有限的硬件上运行极大型模型成为可能,从而可能使先进的 AI 功能的访问民主化。
排序理由 该集群描述了一个用于运行现有模型的新软件工具(推理引擎),而不是一个新的模型发布或研究突破。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →