PulseAugur
实时 11:04:33
English(EN) Generalized Convexity and Smoothness via Conjugate Duality: Optimization Theory for Deep Neural Networks

新的优化理论统一了深度神经网络的凸性和光滑性

研究人员为深度神经网络(DNN)引入了一个新颖的优化框架,该框架推广了经典的凸性和光滑性概念。这个新框架,称为 $\mathcal{H}(\psi)$-凸性和 $\mathcal{H}(\Psi)$-光滑性,统一了凸性和非凸性,以及光滑性和非光滑目标。该研究还提出了广义梯度下降和SGD方法,理论上证明了最优学习率为1并推导了收敛率。研究进一步将DNN训练分析为一个复合优化问题,将收敛性与梯度能量减少和雅可比范数控制联系起来,并引入了梯度相关因子和模型容量风险等因素来表征训练动态。 AI

影响 引入了一个统一的DNN优化理论框架,可能导致更稳定、更高效的训练方法。

排序理由 该集群包含一篇详细介绍深度神经网络优化理论进展的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的优化理论统一了深度神经网络的凸性和光滑性

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Binchuan Qi ·

    广义凸性和光滑性通过共轭对偶:深度神经网络的优化理论

    arXiv:2608.09523v1 Announce Type: new Abstract: Deep neural network (DNN) training with stochastic gradient descent (SGD) and its variants achieves strong empirical performance, yet classical optimization theory does not fully explain this success. This limitation arises because …