PulseAugur
实时 11:01:59

ExactMoE 将 MoE 模型内存使用量减少 87%,准确性损失极小

研究人员开发了 ExactMoE,一种用于稀疏专家混合(MoE)语言模型的新型推理设计,可显著降低内存需求。通过仅对激活的专家应用四位权重量化并将它们存储在特定格式中,ExactMoE 在保持高推理吞吐量和准确性的同时,大幅减少了峰值 GPU 内存使用量。该方法允许仅存储和移动必要的专家组件,解决了大型 MoE 模型面临的关键部署挑战。 AI

影响 通过大幅减少内存占用,实现大型 MoE 模型更高效的部署,从而可能降低推理成本并提高可访问性。

排序理由 该集群包含一篇详细介绍 MoE 模型推理新优化技术的 ist 论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

ExactMoE 将 MoE 模型内存使用量减少 87%,准确性损失极小

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Amjad Saab ·

    每位专家都算数:ExactMoE 实现内存高效 W4A16 推理

    arXiv:2608.15383v1 Announce Type: new Abstract: Sparse mixture-of-experts (MoE) language models reduce arithmetic by activating only a small subset of experts per token, yet deployment still requires storing and moving the full expert bank. We present ExactMoE, an inference desig…