Signum
PulseAugur coverage of Signum — every cluster mentioning Signum across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
LionMuon 优化器通过混合方法降低 LLM 预训练成本
研究人员开发了 LionMuon,这是一种旨在降低预训练大型语言模型的高昂计算成本的新型优化器。LionMuon 在计算成本高昂的谱步(类似于 Muon)和成本较低的符号步(类似于 Lion)之间交替进行。这种混合方法利用共享的动量缓冲区,旨在与现有的优化器(如 AdamW、Lion 和 Signum)相比,以更少的训练时间和更小的内存占用实现更低的损失。在 FineWeb 上训练的模型进行的实验证明了 LionMuon 在达到更低损…
-
LionMuon 优化器提供高效的大规模模型训练
研究人员推出 LionMuon,这是一种新颖的优化器,专为高效的大规模机器学习模型训练而设计。这种新方法在 Lion 和 Muon 的更新步骤之间交替进行,利用共享的动量缓冲区来降低计算成本,同时保持强大的方向准确性。实验表明,LionMuon 在各种数据集和模型大小上均优于 Muon、Lion、Signum 和 AdamW 等现有优化器,以更少的计算量实现了更低的验证损失。
-
新的自适应批次大小方法将训练步骤减少多达 66%
研究人员开发了一种新的机器学习自适应批次大小方法,该方法考虑了诸如 signSGD 和谱下降等优化器的非欧几里得几何。该方法使用局部 mini-batch 梯度估计非欧几里得梯度噪声尺度,可以显著减少训练步骤。实验表明,使用 signSGD 和谱下降对一个拥有 1.6 亿参数的 Llama 模型,训练步骤减少了多达 66%,同时验证损失与恒定批次基线相匹配。
-
Adam 和 Muon 优化器在神经网络中表现出隐式偏差
研究人员分析了动量优化器(如 Adam 和 Muon)应用于光滑齐次神经网络时的隐式偏差。他们的发现表明,在特定的学习率调度下,动量最速下降算法(包括 Muon、MomentumGD 和 Signum)可以近似作为最速下降轨迹。这种偏差导致这些算法倾向于相应的边际最大化问题的 KKT 点,其中 Adam 特别最大化了 L-infinity 边际。
-
LionMuon 优化器降低大型模型训练成本
研究人员推出 LionMuon,这是一种新颖的优化算法,旨在高效训练大规模模型。该方法在 Lion 的低成本更新和 Muon 的更强但成本更高的谱更新之间交替进行。通过共享单个动量缓冲区,LionMuon 在保持有效性的同时显著降低了平均迭代成本。实验表明,LionMuon 在各种模型大小和数据集上均优于 Muon、Lion、Signum 和 AdamW 等现有优化器,以更少的计算量实现了更低的验证损失。