一篇题为“破碎的组合性”(Shattered Compositionality)的新研究论文探讨了 transformer 在进行算术任务训练时的学习动态。由 Xingyu Zhao 领导的研究发现,这些模型通常以相反或并行的顺序习得技能,偏离了类似人类的顺序学习。这种“破碎的组合性”归因于与训练数据的相关性匹配,而非因果推理,导致了特征性的混合错误和鲁棒性降低。研究表明,即使在现代大型语言模型中,这些问题依然存在,并且通过扩展模型规模或使用草稿纸式监督也无法解决。 AI
影响 凸显了 transformer 在算术推理和鲁棒性方面的局限性,表明当前的训练方法可能无法培养出类似人类的组合技能。
排序理由 研究论文,详细介绍了 transformer 学习动态的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- large-language models
- ScienceCast
- transformers
- Xingyu Zhao
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →