研究人员发现了一个新的深度神经网络训练不稳定的关键因素,称为“权重范数临界性”。这种现象不同于普遍理解的“学习率临界性”,它源于归一化技术和权重衰减之间的相互作用。随着权重衰减的增加,它可能将参数范数推向零,导致更陡峭的损失景观和突然的损失尖峰,从而破坏优化动态。这一发现为解释为什么过度的权重衰减虽然可能提高泛化能力,但最终会阻碍训练提供了机制性解释。 AI
影响 为理解和潜在缓解深度学习模型中的训练不稳定性提供了新的理论框架。
排序理由 该集群包含两篇相同的arXiv论文,详细介绍了理解深度神经网络训练不稳定的新理论机制。
- data normalization
- deep neural network
- Edge of Stability
- generalization
- learning-rate criticality
- Loss Landscape
- loss spikes
- Tikhonov regularization
- Weight-norm Criticality
- arXiv
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →