一篇新的研究论文探讨了 Transformer 模型中 token 状态的移动,并将其与最优传输理论进行比较。该研究分析了 Pythia-160M 和 Pythia-410M 模型,发现在最后一层,token 通常以接近最优的成本移动到其最优目的地。然而,这种对齐在初始层中不太明显,并且随着模型的训练而显著提高。 AI
影响 为理解 Transformer 模型内部工作机制提供了见解,可能为未来的架构改进提供信息。
排序理由 在 arXiv 上发表的研究论文,详细介绍了 Transformer 模型行为的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →