近期两篇arXiv论文深入探讨了长上下文Transformer的训练挑战。第一篇论文识别出一种称为秩崩溃(rank-collapse)的根本性病理,即随着上下文长度的增加,注意力分数变得均匀化,并提出使用$\\log n$的关键因子进行“注意力缩放”(attention scaling)以维持自适应注意力。第二篇论文将长序列Transformer的训练不稳定性,尤其是在低精度算术下,归因于密集局部依赖。该论文认为,这些依赖会导致“注意力-Logit爆炸”(attention-logit explosion),可以通过增加注意力维度或显式建模局部依赖来缓解。 AI
影响 这些论文为改进长上下文Transformer模型的稳定性和效率提供了理论见解,有望带来更强大的LLM。
排序理由 两篇发表在arXiv上的学术论文,详细介绍了Transformer架构局限性的理论和实证发现。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- ScienceCast
- Suvadeep Hajra
- Transformer++
- Zhengjiang Lin
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →