研究人员推出了一种新颖的混合专家(MoE)架构DeaMoE,旨在提高大型语言模型(LLM)的解码效率,尤其是在小批量场景下。这种新结构将专家分组到部门中,允许部门内的参数共享,同时保留单个专家的独特参数。DeaMoE采用两阶段路由策略,以最大限度地减少冗余专家加载,从而显著提高解码速度并减少内存使用。实验表明,DeaMoE可以将加载的权重减少高达50.9%,并在NVIDIA H100 GPU上实现高达2.00倍的速度提升。 AI
影响 该架构通过提高LLM解码效率,有可能显著加速实时AI应用,如编码助手。
排序理由 介绍新模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →