PulseAugur
实时 09:59:13
实体 Gated Attention

Gated Attention

PulseAugur coverage of Gated Attention — every cluster mentioning Gated Attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_198155 ·

    混合门控注意力框架提升AI模型效率

    研究人员引入了一个名为混合门控注意力(HyGA)的新框架,旨在提高AI模型中注意力机制的效率和容量。HyGA 包含三种不同的门控策略,它们利用来自注意力多个阶段的信息来更全面地控制信息流。该框架还包括低秩矩阵分解和可学习注意力汇聚等技术,以提高训练效率和稳定性。实验表明,HyGA 在训练损失和下游性能方面均优于传统的门控注意力,在各种基准测试中提供了更有效、更高效、更稳定的注意力解决方案。

  2. TOOL · CL_180595 ·

    研究人员查明驱动大型语言模型中注意力汇聚点的“P0-Sink Circuit”

    研究人员在 Transformer 模型中识别出一个特定的子网络,称为 P0-Sink Circuit,它负责零号位“注意力汇聚点”现象。该电路源于因果注意力的固有结构特性,而非语义内容。实验表明,两种无参数方法可以有效加速该零号位汇聚点的形成,从而提高预训练和下游性能,甚至优于门控注意力基线。

  3. TOOL · CL_160652 ·

    新的TRSP方法解决了大型语言模型中的表示坍塌问题

    研究人员引入了一种名为拓扑正则化侧通路(TRSP)的新方法,以解决大型语言模型(LLMs)中的表示坍塌问题,该问题会随着上下文的增加而降低性能。TRSP使用一种无参数的三角盒机制来平衡注意力动态的光谱特性,从而提高混合效率和信息容量。实验证明了TRSP的有效性,在通用能力和长上下文基准测试中取得了显著的提升,尤其是在扩展训练长度的情况下,在NoLiMa上保持了83%的准确率,并且优于Differential Transformer和G…

  4. RESEARCH · CL_105018 ·

    Tapered Language Models 通过重新分配参数来提高性能

    研究人员推出了一种名为 Tapered Language Models (TLMs) 的架构创新,该创新重新分配了模型层之间的参数。TLMs 不采用均匀分布,而是为早期层分配更多容量,为后期层分配更少容量,这已被证明可以提高困惑度(perplexity)和下游性能。这种方法应用于 Transformers 和 Gated Attention 等各种架构中的 MLPs,在不增加参数数量或计算成本的情况下实现了这些收益。

  5. TOOL · CL_15969 ·

    Attention Sink 研究揭示了 LLM 注意力层中固有的 MoE 结构

    研究人员发现,大型语言模型中的注意力汇聚现象(即第一个 token 获得不成比例的注意力)会在注意力层内自然形成一个专家混合(MoE)机制。这一发现有助于解释仅部分注意力头被利用的“头坍塌”问题。为解决此问题,研究者提出了一种新的、具有辅助负载均衡损失的 Sink-Aware 训练算法,该算法在不同注意力机制上均显示出改进的性能和有效的头负载均衡。