研究人员开发了一个计算高效的框架,用于确定大型混合专家(MoE)模型中的最优学习率。这个两步过程包括在不同宽度的模型之间迁移最优学习率,然后推断到海量token预算。通过在小型代理模型上进行线性回归,该方法可以准确预测长达10万亿token的训练视野的理想学习率,显著降低了计算成本。该框架成功应用于预训练一个1550亿参数的基础模型,验证了其有效性。 AI
影响 降低了训练大型MoE模型的计算成本,实现了更有效的扩展。
排序理由 学术论文,详细介绍了一种训练大型模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →