研究人员为深度神经网络(DNN)引入了一个新颖的优化框架,该框架推广了经典的凸性和光滑性概念。这个新框架,称为 $\mathcal{H}(\psi)$-凸性和 $\mathcal{H}(\Psi)$-光滑性,统一了凸性和非凸性,以及光滑性和非光滑目标。该研究还提出了广义梯度下降和SGD方法,理论上证明了最优学习率为1并推导了收敛率。研究进一步将DNN训练分析为一个复合优化问题,将收敛性与梯度能量减少和雅可比范数控制联系起来,并引入了梯度相关因子和模型容量风险等因素来表征训练动态。 AI
影响 引入了一个统一的DNN优化理论框架,可能导致更稳定、更高效的训练方法。
排序理由 该集群包含一篇详细介绍深度神经网络优化理论进展的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Convex conjugate
- Deep Neural Networks
- generalized gradient descent
- generalized SGD
- gradient descent
- Jacobian matrix
- Legendre Functions
- SGD
- stochastic gradient descent
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →