研究人员开发了两种新的 Muon 优化器变体,名为 Muon-NSR 和 Muon-VS,旨在提高语言模型预训练的效率。这些变体通过整合梯度方差信息来调整 Muon 的正交动量更新,类似于 Adam 风格的方法。在 Llama 风格和 GPT-2 模型上的实验表明,特别是 Muon-VS,与标准的 Muon 优化器相比,在达到目标验证损失方面实现了 1.33 倍的加速。 AI
影响 将方差自适应调制引入 Muon 风格的优化器,有可能降低大型语言模型的计算成本并加速训练。
排序理由 该集群包含一篇详细介绍语言模型预训练优化器新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →