gradient clipping
PulseAugur coverage of gradient clipping — every cluster mentioning gradient clipping across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
四篇arXiv论文推进随机优化理论 · 跟踪4个来源
四篇新研究论文发表在arXiv上,探讨了随机优化方法的高级收敛性质。第一篇论文为具有收缩性、马尔可夫性和乘性噪声的随机逼近的稳态收敛性引入了统一理论,在Wasserstein-2距离上实现了最优的$O(\sqrt{\alpha})$速率。另一篇论文证明了带裁剪和加性高斯噪声的随机梯度下降的几乎处处收敛性,并将其扩展到动量变体。第三项研究分析了重尾噪声和Hölder平滑下SGD的收敛速率,为具有挑战性条件下的梯度裁剪方法提供了新的保证。…
-
新的梯度下降方法在过参数模型上展现指数级收敛性
研究人员提出了一种用于优化过参数模型的新方法——双空间预条件梯度下降(Dual Space Preconditioned Gradient Descent)。该方法包含归一化梯度下降(Normalized Gradient Descent)和梯度裁剪(Gradient Clipping)等变体,已被证明在线性模型上可以指数级收敛到完美拟合数据的解。研究还探讨了这些方法的隐式偏差,表明收敛点可能取决于步长,并提供了一种近似偏差性质,将预…
-
梯度泄露攻击威胁电路设计的GNN
一篇新的研究论文详细介绍了对用于电路设计和硬件安全的图神经网络(GNN)的梯度泄露攻击(GLA)的首次全面评估。研究表明,GLA可能暴露门类型和硬件木马属性等敏感信息,从而可能帮助对手。虽然GIN等一些GNN架构提供了更强的韧性,但GAT等其他架构可能会加剧泄露。现有的防御技术效果有限,并且可能降低模型性能,这表明需要更强大的隐私保护解决方案。
-
GradientStabilizer 通过控制梯度范数来提高 LLM 训练稳定性
研究人员开发了一种名为 GradientStabilizer 的新方法,以提高深度学习系统(尤其是大型语言模型)的训练稳定性。该技术解决了由罕见但极端的梯度范数峰值引起的训练中断问题。与传统的梯度裁剪不同,GradientStabilizer 在保持梯度方向的同时,用统计上稳定的估计值替换更新幅度,从而确保更新幅度有界,不受峰值大小的影响。在包括 LLM 预训练和图像分类在内的多个领域的实验表明,GradientStabilizer …