NVIDIA 研究人员发布了新发现,表明 AdamW 优化器可能存在规模上限。他们的工作表明,在用于预测下一个 token 的批量大小高达 1000 万个 token 时,SOAP 和 Muon 等优化器能够保持训练稳定性和质量,而 AdamW 则会下降。研究人员通过正交化和预条件处理解决了 SOAP 在大批量情况下的不稳定性问题,证明了在训练数万亿 token 的数十亿参数模型时,Muon 和 SOAP 的表现始终优于 AdamW。这项研究还介绍了一种与 Megatron-LM 兼容的层级分布式优化器。 AI
影响 表明一种常用优化器可能存在局限性,可能推动在大型模型训练中采用替代方案。
排序理由 关于 AI 模型训练优化器研究发现的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 X — Omar Sanseviero (HF research) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →