研究人员已证明,使用光滑的Polyak-Lojasiewicz预测损失函数,可以实现宽两层线性网络的全局指数收敛。研究表明,因子中的梯度流可以通过有限维Bures流精确描述,该流受神经元定律协方差的影响。只要初始协方差满足谱支撑间隙条件,均值场守恒定律就能建立隐藏预处理块的谱下界,从而进一步支持了这种收敛速率。这些发现延伸到深度线性ResNets,并通过比较预测速率和观察速率的数值实验进行了说明。 AI
影响 为训练线性神经网络提供了理论保证,可能为未来的优化技术提供参考。
排序理由 关于神经网络训练理论收敛特性的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Bures flow
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Polyak-Lojasiewicz
- Resnet
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →