PulseAugur
实时 05:17:07
English(EN) Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

面向大型MoE模型的计算高效超参数迁移

研究人员开发了一个计算高效的框架,用于确定大型混合专家(MoE)模型中的最优学习率。这个两步过程包括在不同宽度的模型之间迁移最优学习率,然后推断到海量token预算。通过在小型代理模型上进行线性回归,该方法可以准确预测长达10万亿token的训练视野的理想学习率,显著降低了计算成本。该框架成功应用于预训练一个1550亿参数的基础模型,验证了其有效性。 AI

影响 降低了训练大型MoE模型的计算成本,实现了更有效的扩展。

排序理由 学术论文,详细介绍了一种训练大型模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

面向大型MoE模型的计算高效超参数迁移

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim ·

    循序渐进:面向大规模混合专家的计算高效超参数迁移

    arXiv:2608.20061v1 Announce Type: cross Abstract: Mixture-of-Experts (MoE) architectures significantly expand model capacity without a proportional increase in computational cost. However, optimizing their hyperparameters---particularly the learning rate---at extreme scales of bo…