grokking
PulseAugur coverage of grokking — every cluster mentioning grokking across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
AI 行业周报:Gemini 4、FTC 调查与 Grokking 详解
Eigenform AI 的每周人工智能行业摘要“来自未来的报告”涵盖了 Gemini 4 Argon 评估、对 OpenAI 和 Anthropic 等主要人工智能公司的 FTC 调查,以及对 grokking 的解释等主题。该摘要旨在追踪和聚类人工智能领域的讨论,同时关注模型性能和监管问题。
-
新的“幅度势能”指标有助于神经网络泛化分析
研究人员引入了一个名为“幅度势能”的新概念,该概念源自度量幅度理论,以更好地理解神经网络的泛化能力。该量在logit层计算,反映了一个点在数据集中的表示程度。实验表明,该幅度势能的比率与记忆分数相关,并且可以检测决策边界的结构变化,作为模块化算术任务中“grokking”的几何指标。即使在抑制神经网络坍塌的情况下,幅度势能也保留了关于几何结构的信息。
-
AI领悟机制与低损耗区域失配相关
研究人员发现了一种新的“领悟”(grokking)现象的机制,即AI模型在过拟合训练数据后表现出延迟泛化。他们基于低损耗区域几何形状的分析框架表明,当训练集和验证集分区导致低损耗区域失配时,就会发生领悟。在对transformer进行的一个特定反例中,一个保持对称性的分割阻止了领悟,这表明当这些区域未对齐时,仅靠训练超参数是不够的。
-
新理论解释机器学习模型中的“Grokking”现象
研究人员开发了一种统计理论来解释“Grokking”现象,即模型在与训练数据拟合的阶段之外学习底层信号。该理论描述了正则化几何和信号稀疏性如何影响插值附近的泛化能力,尤其是在高维回归中。在对角线性网络和Transformer上的实验证明了该理论的预测,揭示了最小范数插值中存在的统计不稳定性,其中正则化强度的小变化可能导致泛化能力显著不同,同时保持较低的训练误差。
-
研究深入探讨神经网络的grokking现象,揭示迁移带来的益处和复发风险
一篇新研究论文探讨了“grokking”现象背后的机制,即神经网络在一段表现不佳的时期后能够快速泛化。该研究在模块化算术任务上进行,发现与嵌入和读出层一起迁移内部模型权重,可以显著提高早期准确性并缩短达到泛化所需的时间。然而,持续训练可能导致性能复发,这可以通过冻结迁移的组件或使用验证触发的门控来缓解。
-
新的复杂度控制器加速AI模型“领悟”
研究人员开发了一种新的可微分复杂度估计器 $K^{\mathrm{CDM}}_{\mathrm{s}F}$ 来研究机器学习中的“领悟”(grokking)现象。这种新颖的方法允许将微积分应用于学习动力学,从而使系统能够充当加速“领悟”的控制器。研究发现,这种复杂度控制器可以用显著更少的干预实现与传统方法类似的结果,并且只有映射复杂度准确地标记了过渡的完成。
-
神经网络中的 Grokking 转换已量化,数据复杂度是关键
研究人员量化了神经网络中从记忆到泛化的转换现象,即 grokking。他们发现 grokking 发生时间存在幂律标度关系,表明数据复杂度比模型容量更重要。研究还确定了与权重衰减相关的清晰相边界,并观察到转换过程中权重范数的单调压缩,这表明隐式正则化倾向于更简单的解决方案。
-
受生物启发的机制可增强人工智能模型的泛化能力
研究人员探索了受生物启发的机制,以改善多层感知机中的“领悟”现象,即模型从记忆过渡到泛化。通过引入输入门控、结构可塑性和稳态等特性,他们观察到某些机制显著增强了这种过渡。稳态被证明是最具影响力的,其次是结构稀疏化,这表明调节神经元利用率和有效连接可以加速可泛化表征的发展,可能使大型语言模型受益。
-
新研究详解神经网络泛化中的“通道化”现象
研究人员在过参数化神经网络中识别出一种称为“通道化”的现象,它描述了拟合训练数据的解的选择在训练过程中如何演变。这一过程在三个“grokking”任务中均有观察到,涉及在可见泛化出现之前出现的、对权重衰减脉冲的有序时间敏感性。研究表明,这种通道化通过约束解空间来帮助选择泛化能力更好的解。
-
研究论文质疑神经网络中grokking转变机制
一篇新的研究论文探讨了神经网络中“grokking”现象,即模型最初表现不佳,但在记忆了训练数据后,其泛化能力会迅速提高。该研究调查了这种急剧转变是否由插值流形的正常双曲性丧失引起,这是动力学系统中的一个概念。研究人员使用基于残差雅可比矩阵的最小非零奇异值的诊断工具,发现该值在转变过程中并未崩溃,这表明泛化能力的提高可能是一个平滑的漂移,而不是一个分岔事件。
-
新型优化器CvAdamW加速神经网络“领悟”
研究人员推出了一种新颖的AdamW优化器变体CvAdamW,旨在加速神经网络中的“领悟”(grokking)现象。领悟是指模型在记忆训练数据后实现泛化。通过将Transformer注意力视为一个热力学系统并监测其比热(Cv),CvAdamW能够动态调整权重衰减,在泛化转换即将发生时进行干预。该方法在模块化算术任务上,比标准训练显著更早地实现了领悟,在某些实验中平均领悟延迟减少了250多个epoch。研究结果表明,神经网络可能存在可检测…
-
新模型通过关注可表性来解释神经网络的涌现现象
研究人员开发了一个新模型来理解神经网络中的涌现现象,即泛化延迟的现象。该模型使用模运算任务上的全纯单项式激活函数,证明了可表性是关键。当网络的表达函数类崩溃为代数簇时,任务要么立即解决,要么无法拟合,从而消除了典型的涌现状态。研究在 585 次运行中显示出 99.8% 的准确率预测这些结果,为容量-涌现关系提供了新视角。
-
新研究详细介绍了有效加速人工智能模型训练的因素
研究人员确定了影响表征先验在加速人工智能模型训练(尤其是在 Grokking 现象中)方面有效性的关键因素。他们的研究结果表明,先验与正确特征族的对齐对于泛化至关重要,而无标签不变性先验可以显著加快训练速度。此外,在训练过程早期应用这些先验会产生最显著的好处,一个短暂的早期窗口可以捕获几乎所有的性能提升。
-
研究确定了有效表征先验以实现人工智能模型泛化的关键因素
一篇新研究论文探讨了使表征先验在机器学习中有效的因素,特别是在模型从记忆转向泛化的“grokking”的背景下。这项涉及 188 次新运行的研究发现,将先验的特征族与任务对齐至关重要,因为错误的特征族会阻碍泛化。无标签不变性先验使用交换对作为正例,展示了可靠的加速,并且当与权重范数钳位结合时,实现了显著的提速。研究还表明,这些先验在训练过程早期应用时最有效,短暂的应用窗口可以捕获大部分好处。
-
新技术将神经网络泛化速度提高了 52 倍
研究人员推出了一种名为几何维度正则化(GeomDR)的新技术,用于影响神经网络中的“grokking”现象。Grokking 指的是模型在初始阶段记忆数据,然后才泛化,这一过程尚不明确。这篇 arXiv 论文详细介绍了这种新方法,它利用谱正则化在训练过程中改变隐藏表示的维度。实验表明,GeomDR 可以显著加速泛化,在某些情况下比标准的 AdamW 训练提高了 52 倍,并且在不同的网络架构和任务中都有效。
-
新的审计工具揭示表示压缩在神经网络中滞后于泛化
开发了一个新的审计工具来分析神经网络中的“grokking”现象,特别是检查泛化后表示的压缩情况。该工具显示,对于模运算任务,嵌入压缩在泛化后可以持续数万步,显著高估了收敛值。研究表明,在 transformer 中添加 LayerNorm 可以减少 grokking 阶段的压缩程度。
-
新研究揭示权重方向而非幅度携带可迁移的电路身份在神经网络中
研究人员开发了一种名为跨轨迹嵌合体干预的新方法,用于研究神经网络中学习到的特征的可移植性。通过将权重向量分解为幅度和方向分量,并在独立训练的网络之间重新组合它们,他们发现权重的方向携带可迁移的电路身份,而幅度则具有更有限的、分布式的效果。这表明权重方向决定了网络接近的具体解决方案及其被覆盖的敏感性。
-
研究将AI涌现延迟与表征结构形成联系起来
研究人员调查了涌现现象,即模型在完全记住训练数据后很长一段时间内仍然能够泛化。通过对单层Transformer的实验,他们因果性地证明了涌现发生所需的时间直接与任务特定表征结构的形成有关。注入与真实任务结构相关的先验显著加速了涌现,而错误或随机的结构则延迟甚至完全阻止了涌现,这表明模型的内部表征是理解这种延迟的关键。
-
机器学习中的“grokking”现象需要打破数据对称性来实现泛化
研究人员调查了机器学习中的“grokking”现象,即模型在训练中达到高准确率,但直到很久以后才能泛化到新数据。他们使用递归特征机(RFM)算法在代数任务上进行研究,发现泛化取决于打破训练数据集中特定的对称性。RFM算法似乎通过恢复数据中固有的不变性群作用来实现这一点,学习到的特征矩阵编码了该不变性群的元素,从而解释了对称性与泛化之间的联系。
-
研究:可寻址内存对 AI 编辑传播至关重要,而不仅仅是学习
一篇新研究论文探讨了神经网络如何学习和保留信息,区分了“领悟”(grokking)和“编辑传播”(edit propagation)。研究发现,无论是通过循环递归还是内存重读,重复共享访问足以使模型实现“领悟”——一种跨越分布外障碍的学习形式。然而,在模型知识中传播事实性编辑的能力,关键在于是否存在可寻址内存,而不仅仅是递归计算。