PulseAugur
实时 13:11:12
实体 Attention Sinks

Attention Sinks

PulseAugur coverage of Attention Sinks — every cluster mentioning Attention Sinks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_180595 ·

    研究人员查明驱动大型语言模型中注意力汇聚点的“P0-Sink Circuit”

    研究人员在 Transformer 模型中识别出一个特定的子网络,称为 P0-Sink Circuit,它负责零号位“注意力汇聚点”现象。该电路源于因果注意力的固有结构特性,而非语义内容。实验表明,两种无参数方法可以有效加速该零号位汇聚点的形成,从而提高预训练和下游性能,甚至优于门控注意力基线。

  2. TOOL · CL_148163 ·

    Attention Sinks: Why Early Tokens Are Critical for LLM Stability

    一项技术分析表明,序列中的早期标记(称为“注意力汇聚点”)对于基于 Transformer 的大型语言模型的稳定运行至关重要。这些汇聚点充当注意力概率质量的停泊点,防止其破坏真实标记的表示。当这些初始标记被移除时,尤其是在使用滑动窗口 KV 缓存的流式 LLM 架构中,模型性能会显著下降,这种现象被称为“注意力汇聚点”。

  3. TOOL · CL_104717 ·

    新研究将 Transformer 路径病理与通用路由机制联系起来

    arXiv 上的一篇新论文提出,像注意力汇聚点(attention sinks)和表征塌陷(representation collapse)这样的常见 Transformer 病理并非注意力机制独有,而是内容路由在固定相似度度量下的固有缺陷。该研究将 softmax 注意力重新定义为欧氏距离上的玻尔兹曼加权聚合,并提出路由与表征不匹配的路由器会导致路由集中并使表征塌陷。这种现象在包括 Transformer、图注意力(graph at…

  4. RESEARCH · CL_14113 ·

    研究人员通过注意力控制和算法捕获探索高效 Transformer

    研究人员正在探索提高 Transformer 效率和理解力的方法。一篇论文引入了预算注意力分配(Budgeted Attention Allocation),这是一种允许成本-质量权衡的头门控机制。另一项研究定义了 Transformer 中的算法捕获(algorithmic capture),并分析了它们的计算复杂性,表明存在一种归纳偏见,反对更高复杂度的过程。此外,关于 Transformer 中局部注意力的工作证明了其表达能力以…