研究人员开发了 RotaryQuant,一个旨在使大型专家混合(MoE)语言模型能在消费级硬件上运行的新型压缩系统。该系统采用三轴压缩策略,包括混合精度权重量化、LRU 专家卸载以及用于 KV 缓存压缩的 IsoQuant。这种方法允许 Nemotron-H 120B 等模型在 32GB 内存预算内运行,同时保持接近零的困惑度下降和高检索准确率。 AI
影响 使大型 MoE 模型能在消费级硬件上运行,可能使先进的 AI 能力的获取更加普及。
排序理由 该集群描述了一种新颖的压缩技术,该技术在 arXiv 论文中提出,用于将大型语言模型适配到消费级硬件。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →