实体
Modular Addition
Modular Addition
PulseAugur coverage of Modular Addition — every cluster mentioning Modular Addition across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
研究发现:AI遗忘效果与学习策略相关
一篇新论文探讨了AI模型学习方式与其遗忘能力之间的关系。研究人员发现,在训练过程中更依赖记忆的模型,在尝试遗忘特定信息时会经历更大的性能下降,这种现象被称为“保留损害”。在包括模块加法任务和大型语言模型遗忘以进行回忆等各种场景中都观察到了这种趋势。
-
新研究挑战标准神经缩放指数推导
一篇新研究论文提出了一种替代标准神经缩放指数的几何推导方法,该方法通常依赖于数据流形的内在维度。作者们证明,对于 $\mathbb{Z}_p$ 中的模加法,这种标准方法是未定义的,因为精确的代数解涉及作用于等距变换的 $\mathbb{Z}_p$ 轨道。相反,他们表明这种关系遵循与网络隐藏宽度相关的指数曲线,具有很高的 R 方值,表明该模型能更好地捕捉观察到的行为。
-
Muon训练的Transformer出现后涌现崩溃,失去泛化能力
一篇新研究论文探讨了在用Muon优化器训练的Transformer中一种被称为“后涌现崩溃”的现象。虽然Muon最初在模块化加法任务上表现出更快的学习速度,但模型最终会失去泛化能力。这种失败发生在模型内部表示与其输出层之间的接口处,在特定条件下,Muon优化器和AdamW嵌入的行为不同。研究表明,当模型中与任务对齐的组件被隔离时,可以恢复性能,这表明崩溃并非由于根本性的表示退化,而是表示-读出接口处的问题。