SignSGD
PulseAugur coverage of SignSGD — every cluster mentioning SignSGD across labs, papers, and developer communities, ranked by signal.
-
新研究将 Transformer 优化问题与梯度异质性联系起来
一篇新研究论文探讨了 Transformer 模型在优化方面的挑战,特别是在微调场景下。该研究发现,梯度异质性(参数块之间梯度范数的变异)是导致标准基于梯度的优化方法(如 SGD)收敛困难的关键因素之一,与 Hessian 异质性共同作用。研究表明,自适应优化器(如 Adam)和基于符号的方法(如 SignSGD)对这种异质性不太敏感。论文还指出,层归一化的放置(Post-LN 架构表现出特别明显的异质性)对该问题有显著影响。实验验证…
-
新研究分析基于符号的优化算法的收敛性
一篇新的研究论文探讨了非凸优化的基于符号的随机重排算法的收敛性质。该研究分析了SignRR算法,它是signSGD的一个变体,在重排后顺序处理数据,并证明这种重排并不能完全纠正丢弃梯度幅度所引入的偏差。该论文为SignRR提供了有限时间界,并提出了SignRVR,一种方差缩减的替代方案,它提供了改进的平稳性界。
-
新的 SignMuon 方法将 AI 模型更新压缩至每参数一比特
研究人员开发了 SignMuon,一种将模型更新压缩至每参数一比特的方法,显著降低了通信开销。虽然 SignMuon 在实践中优于 SignSGD,但它在某些函数上仍可能发散。通过误差反馈修复此问题的尝试结果好坏参半,应用于梯度的误差反馈在实现非凸问题的标准收敛率方面被证明是有效的。实验结果表明,在线性最小化预言机(LMO)之后对梯度进行符号化的启发式方法,比理论上保证收敛的方法在规模上更有效。
-
新框架提升联邦学习的安全性与效率
研究人员开发了一个新的联邦学习框架,该框架提高了基于签名的安全性和效率。该方法通过安全地计算多数投票多项式来确保信息论安全,只向服务器揭示聚合后的签名。该框架采用了逆形式指数约减和单轮安全乘法等技术,显著降低了通信和延迟,在线通信减少高达 99.5%。此外,它还能抵御掉线和对抗性行为,从而大幅提高准确性。
-
研究论文详述学习率冷却的有效性如何取决于噪声和优化器归一化
一篇新的研究论文探讨了学习率冷却阶段在大型模型预训练中的有效性,这是预热-稳定-衰减(WSD)调度的一个常见组成部分。研究表明,这种冷却的好处取决于梯度噪声的结构与优化器是否采用归一化之间的相互作用。在没有归一化的情况下,随机梯度下降(SGD)会自然收缩,并且从冷却中获益甚少。然而,归一化方法和SignSGD可能会陷入噪声地板,此时冷却可能根据具体的噪声特性提供改进。
-
新的自适应批次大小方法将训练步骤减少多达 66%
研究人员开发了一种新的机器学习自适应批次大小方法,该方法考虑了诸如 signSGD 和谱下降等优化器的非欧几里得几何。该方法使用局部 mini-batch 梯度估计非欧几里得梯度噪声尺度,可以显著减少训练步骤。实验表明,使用 signSGD 和谱下降对一个拥有 1.6 亿参数的 Llama 模型,训练步骤减少了多达 66%,同时验证损失与恒定批次基线相匹配。
-
Muon 优化器分析揭示了与 SignSGD 不同的收敛阶段
研究人员分析了随机谱优化器,包括 Muon,在一个高维矩阵值最小二乘问题中。他们的分析表明,Muon 所近似的 SignSVD,对于大批量大小,会相对于数据协方差谱进行平方根预处理。相比之下,较小的特征模式在小批量大小时表现得像 SGD,减缓了收敛速度,而 SignSGD 对通用协方差不提供预处理,导致不同的最优学习率和收敛特性。
-
SignSGD和Muon优化器的性能提升得到理论解释
研究人员从理论上分析了像SignSGD和Muon这样的基于符号的优化算法为何能在训练大型模型时优于标准SGD。一项新研究表明,SignSGD的优势源于其在特定条件下的有效性,例如稀疏噪声和$\\ell_1$-范数平稳性,而标准SGD在处理这些条件时效率不高。另一篇论文质疑了Muon复杂几何结构的必要性,提出像随机或反向谱等更简单的方法可以通过关注局部对齐和下降潜力来实现类似的性能。
-
研究人员分析Adam的权衡并用混合切换策略增强SignSGD
两篇新研究论文探讨了机器学习优化算法的进展。一篇论文对Adam优化器进行了理论分析,详细说明了其在非平稳目标下的性能,并确定了噪声和漂移之间的权衡。第二篇论文通过引入小批量收敛性分析和混合切换策略(包括抖动和向SGD的过渡)来增强SignSGD算法,在图像分类任务上实现了具有竞争力的准确性。