Edge of Stability
PulseAugur coverage of Edge of Stability — every cluster mentioning Edge of Stability across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的“权重范数临界性”解释了AI训练不稳定性
研究人员发现了一个新的深度神经网络训练不稳定的关键因素,称为“权重范数临界性”。这种现象不同于普遍理解的“学习率临界性”,它源于归一化技术和权重衰减之间的相互作用。随着权重衰减的增加,它可能将参数范数推向零,导致更陡峭的损失景观和突然的损失尖峰,从而破坏优化动态。这一发现为解释为什么过度的权重衰减虽然可能提高泛化能力,但最终会阻碍训练提供了机制性解释。
-
研究论文将梯度下降重构为动力系统
一篇新研究论文将有限步梯度下降探索为离散动力系统,而非简单的优化工具。该研究分析了训练图的行为,包括稳定性边缘和振荡等现象,如何受到学习率的影响。通过检查深度学习的简化模型,该研究表明学习率是塑造梯度下降所选表示的基本结构参数,而不仅仅是数值稳定性常数。
-
新的研究框架对稳定性边缘的梯度下降进行建模
两篇新的研究论文探讨了深度学习中在稳定性边缘(EoS)运行的梯度下降现象。第一篇论文介绍了“Edge Flow”,这是一个微分方程系统,用于模拟EoS下的梯度下降动力学,将其分解为中心、振荡方向和幅度。第二篇论文提出了一个适用于过参数化神经网络的分岔理论框架,展示了稳定的EoS训练如何从翻转分岔产生,并在特定条件下证明了收敛到最小化流形。
-
研究:稳定性边界选择性地塑造机器学习学习
一篇新的研究论文探讨了机器学习优化中的“稳定性边界”(EoS),揭示它并非一个统一的属性,而是一个选择性的属性。该研究表明,EoS 可以重新分配不同训练数据子集上的学习,可能加速某些群体的进步,同时阻碍另一些群体的进步。该研究确定了数据子集受益于 EoS 的两个关键条件:其聚合梯度必须与最大的 Hessian 特征向量对齐,并且它必须随着时间的推移保持显著的梯度幅度。
-
研究人员查明神经网络“Edge of Stability”现象的起源
研究人员引入了一个名为“边缘耦合”(edge coupling)的新概念,以解释神经网络训练中已知的“Edge of Stability”现象。这个函数应用于连续的迭代对,有助于解释在全批量梯度下降过程中,最大的 Hessian 特征值为何会达到 $2/\eta$(其中 $\eta$ 是学习率)的阈值。所提出的方法在没有任何间隙的情况下精确地强制 Hessian 特征值,为这种观察到的行为提供了更统一的解释。