研究人员在经过特定优化技术和权重衰减训练的线性模型中,识别出一种延迟泛化(grokking)的机制。他们的分析揭示了经验零空间中的一个“grokking子空间”,在该子空间中训练预测保持稳定,从而使权重衰减驱动一个缓慢的弛豫过程。该理论根据正则化强度和优化器选择等因素预测grokking时间,并在合成模型和模加任务中得到了验证。 AI
影响 为理解和潜在控制AI模型中的延迟泛化提供了一个理论框架。
排序理由 该集群包含一篇研究论文,详细介绍了理解机器学习中一种现象的新理论框架。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries
- Hugging Face
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →