研究人员开发了一种统计理论来解释“Grokking”现象,即模型在与训练数据拟合的阶段之外学习底层信号。该理论描述了正则化几何和信号稀疏性如何影响插值附近的泛化能力,尤其是在高维回归中。在对角线性网络和Transformer上的实验证明了该理论的预测,揭示了最小范数插值中存在的统计不稳定性,其中正则化强度的小变化可能导致泛化能力显著不同,同时保持较低的训练误差。 AI
影响 为理解模型泛化提供了理论基础,可能为未来的模型设计和训练策略提供信息。
排序理由 该条目是发表在arXiv上的学术论文,详细介绍了一种新的机器学习现象的统计理论。[lever_c_demoted from research: ic=1 ai=1.0]
- all-zero predictor
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- convex norms
- DagsHub
- Diagonal Linear Networks
- Gotit.pub
- grokking
- Hugging Face
- machine learning
- modular arithmetic
- regression analysis
- ScienceCast
- transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →