两篇新的arXiv论文探讨了神经网络中“领悟”(grokking)现象,即模型在记忆训练数据后才能泛化。其中一篇论文提出“低秩衰减”(Low-Rank Decay, LRD)作为谱正则化器,通过压缩奇异值来改善领悟,并表明它可以加速秩崩溃并扩大泛化能力的数据分数边界。另一篇论文将领悟视为一个约束优化问题,证明了梯度下降在零损失流形上最小化权重范数,并推导出了记忆后动力学的闭式表达式。 AI
影响 这些论文为神经网络中延迟泛化提供了理论见解,可能指导未来的模型训练策略。
排序理由 两篇在arXiv上发表的学术论文,讨论了神经网络中的一个特定现象。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →