专家混合(Mixture-of-Experts, MoE)架构正日益主导大型语言模型领域,在2026年部署的七个最广泛使用的开源模型中,有六个采用了这种方法。该架构最早于2017年提出,它允许模型拥有海量参数(代表知识容量),但每次仅激活一小部分来处理输入令牌,从而显著降低了每令牌的计算成本。DeepSeek V4.1 Flash和Xiaomi MiMo-V2.6 Pro等近期发布的模型展示了这种效率,由于其稀疏激活,它们以更低的每令牌价格提供了前沿水平的智能。然而,其权衡是需要大量的内存,因为无论是否激活,所有专家都必须驻留在VRAM中。 AI
影响 专家混合(Mixture-of-Experts)模型的广泛采用表明,大型语言模型正朝着计算效率更高的方向发展,这可能降低推理成本并支持更大规模的模型。
排序理由 该集群讨论了近期大型语言模型发布背后的技术架构(专家混合,Mixture-of-Experts)及其影响,并得到了研究论文和模型细节的支持。
- DeepSeek
- DeepSeek-V3
- DeepSeek V4.1 Flash
- Hackaday
- Mastodon
- MIT
- mixture of experts
- Shazeer
- Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
- Xiaomi
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →