专家混合(Mixture of Experts, MoE)架构,最早由Jacobs等人于1991年提出,为大型语言模型的规模与成本困境提供了一个解决方案。与密集模型(在每次token计算时激活所有参数)不同,MoE层使用一个门控网络为每个token选择性地激活一小部分专门的“专家”网络。这使得像DeepSeek-V3这样拥有数千亿参数的模型,在每次计算时只需激活其中一小部分,从而显著降低成本。Shazeer等人于2017年引入的关键的稀疏门控转变,通过确保每个token只由选定的top-k专家处理,实现了实际的计算节省,这是现代MoE LLM的基本原则。 AI
影响 通过降低每个token的计算成本,实现了更高效的LLM扩展。
排序理由 该条目讨论了LLM中专家混合架构的历史发展和技术细节,并引用了关键论文和模型。[lever_c_demoted from research: ic=1 ai=1.0]
- Adaptive Mixtures of Local Experts
- DeepSeek-V3
- Google Brain
- Hinton
- Jordan
- mixture of experts
- Nowlan
- Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer
- Shazeer
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →