研究人员开发了一种 2-单纯复形注意力的线性化版本,将三线性分数重写为内积。这种新形式允许在序列长度上实现线性成本,同时保持全局覆盖范围,这与传统的窗口注意力机制不同。通过使用正随机特征近似求和并将过去的信息存储在固定大小的状态中,该方法可以使用自定义 Triton 内核实现,并与 Kimi Delta Attention 集成。最终的模型完全省略了 softmax 注意力,在 LAMBADA 等基准测试中展示了优越的下游准确率和更高的困惑度。 AI
影响 这项研究引入了一种更高效的注意力机制,有望带来更快、更准确的语言模型。
排序理由 该集群描述了一篇详细介绍 AI 模型新注意力机制的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →