实体
Signum
Signum
PulseAugur coverage of Signum — every cluster mentioning Signum across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新的自适应批次大小方法将训练步骤减少多达 66%
研究人员开发了一种新的机器学习自适应批次大小方法,该方法考虑了诸如 signSGD 和谱下降等优化器的非欧几里得几何。该方法使用局部 mini-batch 梯度估计非欧几里得梯度噪声尺度,可以显著减少训练步骤。实验表明,使用 signSGD 和谱下降对一个拥有 1.6 亿参数的 Llama 模型,训练步骤减少了多达 66%,同时验证损失与恒定批次基线相匹配。
-
Adam 和 Muon 优化器在神经网络中表现出隐式偏差
研究人员分析了动量优化器(如 Adam 和 Muon)应用于光滑齐次神经网络时的隐式偏差。他们的发现表明,在特定的学习率调度下,动量最速下降算法(包括 Muon、MomentumGD 和 Signum)可以近似作为最速下降轨迹。这种偏差导致这些算法倾向于相应的边际最大化问题的 KKT 点,其中 Adam 特别最大化了 L-infinity 边际。
-
LionMuon 优化器降低大型模型训练成本
研究人员推出 LionMuon,这是一种新颖的优化算法,旨在高效训练大规模模型。该方法在 Lion 的低成本更新和 Muon 的更强但成本更高的谱更新之间交替进行。通过共享单个动量缓冲区,LionMuon 在保持有效性的同时显著降低了平均迭代成本。实验表明,LionMuon 在各种模型大小和数据集上均优于 Muon、Lion、Signum 和 AdamW 等现有优化器,以更少的计算量实现了更低的验证损失。