研究人员开发了一种名为PARSER的新方法来压缩混合专家(MoE)大语言模型。现有方法独立压缩各个投影矩阵,这可能由于误差传播导致显著的准确性下降。然而,PARSER通过纳入输出重要性来关注保留专家输出的误差,衡量每个组件对最终误差的贡献。与之前的Qwen和DeepSeek模型上的方法相比,这种方法在保持相似内存缩减的同时,显示出更高的准确性保留率。 AI
影响 该方法通过在不牺牲准确性的情况下减小内存占用,有望实现更高效的大型MoE模型的部署。
排序理由 该集群包含一篇详细介绍LLM压缩新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →