PulseAugur
实时 09:22:03

Transformer 在算术学习中表现出“破碎的组合性”

一篇题为“破碎的组合性”(Shattered Compositionality)的新研究论文探讨了 transformer 在进行算术任务训练时的学习动态。由 Xingyu Zhao 领导的研究发现,这些模型通常以相反或并行的顺序习得技能,偏离了类似人类的顺序学习。这种“破碎的组合性”归因于与训练数据的相关性匹配,而非因果推理,导致了特征性的混合错误和鲁棒性降低。研究表明,即使在现代大型语言模型中,这些问题依然存在,并且通过扩展模型规模或使用草稿纸式监督也无法解决。 AI

影响 凸显了 transformer 在算术推理和鲁棒性方面的局限性,表明当前的训练方法可能无法培养出类似人类的组合技能。

排序理由 研究论文,详细介绍了 transformer 学习动态的新发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Transformer 在算术学习中表现出“破碎的组合性”

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Xingyu Zhao, Darsh Sharma, Rheeya Uppaal, Yiqiao Zhong ·

    破碎的组合性:Transformer 在算术学习中的反直觉动态

    arXiv:2601.22510v2 Announce Type: replace-cross Abstract: Large language models (LLMs) often achieve strong benchmark accuracy yet remain brittle under small distribution shifts. While recent mechanistic studies reveal the discrepancy between LLMs and humans in skill compositions…