一篇新的研究论文探讨了 Transformer 中稀疏注意力机制的“路由吸收”现象。该研究在具有 3100 万参数的 Transformer 和 Qwen3-1.7B 模型上进行,表明当与模型联合训练时,学习到的门相比随机门带来的好处有限。这归因于模型的表征会与施加的掩码共同适应,从而降低了学习到的路由的附加值。研究提出门和模型之间的参数不对称是促成因素之一,并强调了在稀疏注意力方法中随机路由控制以及路由质量和模型适应性单独评估的重要性。 AI
影响 强调了当前稀疏注意力训练方法中潜在的低效率,表明需要修订评估和训练策略。
排序理由 一篇在 arXiv 上发表的研究论文,详细介绍了 Transformer 注意力机制中的一项具体技术发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →