研究人员推出了一种新颖的 ID Balancing 方法,用于训练极稀疏的专家混合(MoE)大语言模型(LLM)。该技术解决了专家负载不平衡的关键问题,而这个问题会阻碍模型扩展时的训练效率和稳定性。通过将现有方法视为 PID 控制器,ID Balancing 提出了一种积分-微分控制器,它能对显著的不平衡提供更强的校正,并在接近平衡时进行更精细的调整。评估表明,ID Balancing 显著降低了不平衡指标,并保持了有竞争力的性能,使其成为扩展更大、更稀疏的 MoE 模型的有前途的解决方案。 AI
影响 增强了极稀疏 MoE LLM 训练的稳定性和效率,从而能够实现更大的参数量和更高的性能。
排序理由 该集群包含一篇详细介绍 LLM 新训练方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepSeek
- Hugging Face
- ID Balancing
- Kimi k3
- Large Language Models (LLMs)
- Mixture of Experts (MoE)
- Quantile Balancing
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →