研究人员推出了一种名为声明式注意力(DA)的新型协议,该协议允许语言模型内在管理其自身的注意力机制。这种方法使模型能够声明需要关注的上下文特定区域,而不是扫描整个KV缓存。在Gemma 4.31B和Qwen-3.6 27B等模型上进行测试时,DA在解码过程中显著减少了被关注的token数量,同时对准确性的影响很小。 AI
影响 该方法通过减少计算开销,有望实现更高效的长上下文语言模型。
排序理由 该集群描述了一篇详细介绍语言模型注意力新方法的论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →