PulseAugur
实时 04:59:46
English(EN) New research from NVIDIA.

NVIDIA 研究表明 AdamW 优化器存在规模上限

NVIDIA 研究人员发布了新发现,表明 AdamW 优化器可能存在规模上限。他们的工作表明,在用于预测下一个 token 的批量大小高达 1000 万个 token 时,SOAPMuon 等优化器能够保持训练稳定性和质量,而 AdamW 则会下降。研究人员通过正交化和预条件处理解决了 SOAP 在大批量情况下的不稳定性问题,证明了在训练数万亿 token 的数十亿参数模型时,Muon 和 SOAP 的表现始终优于 AdamW。这项研究还介绍了一种与 Megatron-LM 兼容的层级分布式优化器。 AI

影响 表明一种常用优化器可能存在局限性,可能推动在大型模型训练中采用替代方案。

排序理由 关于 AI 模型训练优化器研究发现的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 X — Omar Sanseviero (HF research) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

NVIDIA 研究表明 AdamW 优化器存在规模上限

报道来源 [1]

  1. X — Omar Sanseviero (HF research) TIER_1 English(EN) · omarsar0 ·

    来自 NVIDIA 的新研究。

    New research from NVIDIA. Does AdamW have a scale ceiling? This work claims yes, and shows where it sits. At batch sizes up to 100M tokens for next-token prediction, SOAP and Muon maintain training stability and quality while AdamW degrades. Higher-order optimizers have https:…