PulseAugur
实时 10:27:50

新理论解释AI模型中的延迟泛化

研究人员在经过特定优化技术和权重衰减训练的线性模型中,识别出一种延迟泛化(grokking)的机制。他们的分析揭示了经验零空间中的一个“grokking子空间”,在该子空间中训练预测保持稳定,从而使权重衰减驱动一个缓慢的弛豫过程。该理论根据正则化强度和优化器选择等因素预测grokking时间,并在合成模型和模加任务中得到了验证。 AI

影响 为理解和潜在控制AI模型中的延迟泛化提供了一个理论框架。

排序理由 该集群包含一篇研究论文,详细介绍了理解机器学习中一种现象的新理论框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新理论解释AI模型中的延迟泛化

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Taeyoung Kim ·

    Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries

    arXiv:2607.23967v1 Announce Type: new Abstract: Delayed generalization, or grokking, remains poorly understood despite extensive empirical study. We identify an exactly solvable late-time relaxation mechanism for grokking in linear models trained with full-batch heavy-ball optimi…