PulseAugur
实时 09:25:08
English(EN) Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

Muon训练的Transformer出现后涌现崩溃,失去泛化能力

一篇新研究论文探讨了在用Muon优化器训练的Transformer中一种被称为“后涌现崩溃”的现象。虽然Muon最初在模块化加法任务上表现出更快的学习速度,但模型最终会失去泛化能力。这种失败发生在模型内部表示与其输出层之间的接口处,在特定条件下,Muon优化器和AdamW嵌入的行为不同。研究表明,当模型中与任务对齐的组件被隔离时,可以恢复性能,这表明崩溃并非由于根本性的表示退化,而是表示-读出接口处的问题。 AI

影响 探讨了Transformer训练中潜在的故障模式,影响了未来模型开发和优化策略。

排序理由 研究论文,详细介绍了Transformer训练中的一种新现象。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Muon训练的Transformer出现后涌现崩溃,失去泛化能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi ·

    Muon 训练的 Transformer 在表示-读出接口处出现 Post-Grokking 崩溃

    arXiv:2608.07436v1 Announce Type: new Abstract: Under the standard split, Muon gets hidden matrices and AdamW embeddings/output head. Muon groks modular addition faster, but its solutions do not hold. All nine configurations on $(a+b) \bmod 113$ grok and later lose generalization…