研究人员开发了ACE,一个新颖的框架,旨在通过自适应地跳过冗余专家计算来优化混合专家(MoE)大型语言模型。这种无需训练的方法利用全局谱代理和路由器条件细化来估计专家贡献,而不依赖于路由器置信度或校准数据。ACE在各种基准测试和MoE模型上始终优于现有方法,显著降低了困惑度并提高了下游准确性,尤其是在激进的专家跳过场景下。 AI
影响 该方法可以通过减少MoE架构中的计算开销,从而实现更高效的大型语言模型推理。
排序理由 详细介绍优化MoE大型语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Global Spectral Proxy
- large language models
- Mixture-of-Experts
- Qwen3.6 35B-A3B
- RMSNorm
- Router-Conditioned Refinement
- WikiText-2
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →