研究人员评估了轨迹特征在语言模型最后一层中路由注意力的有效性。他们使用 SmolLM3-3B-Base 和 Qwen3.5-4B-Base 的冻结检查点,在留出数据上测试了效用监督路由器。研究发现,与更简单的方法相比,没有一个评估的轨迹特征能显著提高预测准确性。事实上,Qwen3.5 中的固定投影对照组甚至比轨迹路由器降低了负对数似然(NLL),这表明这些复杂摘要在提高推理质量方面的增量价值有限。 AI
影响 这项研究表明,复杂的轨迹特征可能不会显著提高当前大型语言模型中注意力路由的效率或准确性,这可能指导未来的研究转向更简单或不同的方法。
排序理由 该集群包含一篇在 arXiv 上发表的研究论文,详细介绍了语言模型注意力机制的实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Influence Flower
- PG19
- Qwen3.5-4B-Base
- ScienceCast
- SmolLM3-3B-Base
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →