研究人员开发了 LionMuon,这是一种旨在降低预训练大型语言模型的高昂计算成本的新型优化器。LionMuon 在计算成本高昂的谱步(类似于 Muon)和成本较低的符号步(类似于 Lion)之间交替进行。这种混合方法利用共享的动量缓冲区,旨在与现有的优化器(如 AdamW、Lion 和 Signum)相比,以更少的训练时间和更小的内存占用实现更低的损失。在 FineWeb 上训练的模型进行的实验证明了 LionMuon 在达到更低损失和减少挂钟时间方面的有效性。 AI
影响 降低了 LLM 预训练的计算成本,可能加速研发。
排序理由 该集群包含一篇详细介绍语言模型训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →