研究人员调查了损失景观平坦度在神经网络泛化中的作用,特别是在 grokking 现象中。虽然之前的工作表明平坦度是泛化所必需的,但本研究发现,仅使用 Sharpness Aware Minimization (SAM)(它倾向于将训练导向更平坦的解)不足以可靠地诱导 grokking。然而,当 SAM 与权重衰减结合使用时,它能将泛化解的过渡速度在 epoch 层面提高多达四倍。对最小的两层 ReLU 模型的理论分析表明,仅靠平坦度无法区分记忆解和泛化解,但权重衰减有利于泛化,而 SAM 可以通过破坏记忆插值器来加速这一过渡。 AI
影响 提供了对训练动态如何影响模型泛化更细致的理解,可能指导未来的优化技术。
排序理由 学术论文,详细介绍了关于神经网络泛化的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- gradient descent
- grokking
- Hugging Face
- Neural Networks
- Sam
- Sharpness aware minimization
- Tikhonov regularization
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →