PulseAugur
中
实时 19:39:00
实体 softmax attention

softmax attention

PulseAugur coverage of softmax attention — every cluster mentioning softmax attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
25
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
25
90 天内 25
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 27 条
  1. TOOL · CL_284698 ·

    新方法学习 Softmax 注意力模型中的决策阈值

    研究人员开发了一种在双参数 Softmax 注意力模型中学习决策桩阈值的方法。该方法使用基于梯度的预训练,在带标签的上下文及其真实阈值上进行,以仅从上下文推断新阈值。研究详细说明了在具有固定示例的多个任务上进行梯度下降如何导致一个具有特定错误率的冻结估计器,将有限预训练精度与新鲜上下文定位分离开来。该机制涉及协调的参数发散,其中训练校准分数并增加注意力尺度,错误随时间减少。

  2. TOOL · CL_284641 ·

    先验拟合网络通过上下文学习实现统计自适应

    研究人员分析了像TabPFN这样的先验拟合网络(PFNs)如何在学习中实现统计自适应。在一个受控的位置估计问题中,他们发现PFNs能够学习区分不同的数据生成模型(如高斯分布或均匀分布),并相应地调整其估计策略。研究表明,这些网络中的注意力机制计算经验累积量生成函数的导数,使它们能够形成在样本均值和中程之间进行插值的估计器。通过混合或门控线性单元组合注意力专家,并分析梯度流,研究表明PFNs通过充分的预训练可以在各种任务中实现近乎最优的性能。

  3. RESEARCH · CL_271021 ·

    新研究提高了线性注意力的效率和性能

    研究人员正在开发新方法来提高大型语言模型中线性注意力机制的效率和性能。一种方法,Switching Linear Attention (SwiLA),在保持固定大小的循环状态的同时增强了表示能力,与标准 softmax 注意力相比,取得了有竞争力的结果。另一项开发,LeapQuant,专注于线性注意力的精确循环状态量化,在推理中实现了显著的加速,且质量损失很小。此外,对线性注意力的理论分析表明,其循环状态通常具有低秩结构,这表明通过基…

  4. TOOL · CL_269450 ·

    研究发现:混合注意力机制影响LLM多语言能力

    研究人员调查了大型语言模型(LLM)中的混合注意力机制如何影响其多语言能力。这些模型结合了不同类型的注意力来高效处理长序列。研究发现,注意力层的排列方式显著影响跨语言表征的发展,在第一个全注意力层周围观察到了显著的对齐峰值。在多语言数据上进行蒸馏的实验表明,替代的层序排列,特别是从全注意力层开始,优于标准配置,学习速度提高了2.5倍。

  5. TOOL · CL_286013 ·

    Hugging Face 研究建议重新设计多语言LLM的注意力层

    Hugging Face 的一项新研究调查了混合注意力机制对大型语言模型多语言能力的影响。研究人员发现,循环层和全注意力层的排列方式显著影响跨语言表征的形成,在第一个全注意力层之后出现了一个显著的对齐峰值。在多语言数据上进行蒸馏的实验表明,替代的层序排列,特别是以全注意力层开始的排列,与标准配置相比,学习速度提高了2.5倍,这表明多语言模型架构可能需要重新设计。

  6. TOOL · CL_254606 ·

    新的核集技术提高了 Softmax 注意力的效率

    研究人员开发了用于 Softmax 注意力的新型查询无关核集(query-oblivious coresets)构建技术,改进了理论界限并提供了高效的构建方法。这些核集是键值对的子集,可以近似表示任何查询下的完整注意力输出。新方法在理论界限上更接近理论下界,尤其是在 $\rho$ 参数较大的 Qwen2.5-7B-Instruct 和 LLaMA-3-8B-Instruct 等模型中,这表明对注意力机制效率具有实际意义。

  7. RESEARCH · CL_254534 ·

    SpectralShift 通过谱重参数化增强 Gated DeltaNet 上下文窗口 · 跟踪 2 个来源

    研究人员推出 SpectralShift,一种扩展 Gated DeltaNet (GDN) 模型上下文窗口的新颖方法,该模型利用线性注意力机制。与之前专注于持续预训练的方法不同,SpectralShift 对模型的 alpha 投影进行重参数化以优化其谱特性。该技术通过拓宽慢速频谱带并保留用于上下文切换的快速衰减模式来增强模型检索长距离信息的能力。实验表明,SpectralShift 有效地提高了 GDN 的长上下文能力,为扩展其上…

  8. TOOL · CL_227121 ·

    新研究详细介绍了支配softmax注意力秩复杂性的几何定律

    研究人员分析了支配softmax注意力机制秩复杂性的几何特性。该研究确定了两项关键的几何定律:一项用于球形自注意力,另一项用于全球体几何,后者引入了额外的径向自由度。对于固定的注意力头,交互维度被证明遵循特定的上限定律,并且构造证明了其极小极大值的尖锐性。对BERT-base校准集的实证分析显示,在各种头和温度设置下,有效维度有所适度降低,这与理论上限相关。

  9. TOOL · CL_196166 ·

    为 Transformer AI 注意力机制提出量子计算路线图

    一篇新研究论文提出了一种增强 Softmax 注意力机制的量子计算方法,Softmax 注意力是 Transformer AI 模型的核心组成部分。该论文概述了如何利用量子原理,特别是玻恩规则类似物,在概率单纯形上精确实现 Softmax 注意力。该量子框架表明,注意力分数可以通过 Hadamard 测试统计量计算,指数 Softmax 函数可以由余弦平方族表示。这项研究(包括 Lean 4 中的机器检查证明)探讨了量子操作(如旋转门…

  10. TOOL · CL_193842 ·

    软提示可使随机 Transformer 近似函数

    研究人员证明,在适当的软提示引导下,具有随机、未训练权重的单层 softmax 注意力网络可以近似紧致流形上的任何 Hölder 函数。这一发现表明,对于某些近似任务,预训练可能是可选的。该研究将 softmax 注意力与核方法联系起来,构建了显式的软提示,使冻结的 Transformer 能够模拟经典的 Nadaraya-Watson 核估计器。核回归的理论保证得以继承,从而实现了依赖于内在维度的速率的通用逼近定理,并揭示了提示范数…

  11. TOOL · CL_183329 ·

    新算法可证明地学习多头注意力参数

    研究人员开发了一种学习多头softmax注意力的新方法,这是Transformer模型中的一个关键组成部分。这种新算法可以在不需要先验知识正交子空间的情况下恢复这些注意力头的参数,而这是先前方法的局限性。该方法通过合并具有相同权重的头并对其对应的数值进行求和来实现,从而有效地创建了一个规范表示。该算法通过查询任意token序列并分析由此产生的标量输出来实现这一点,使用特定数量的查询来高概率地重建注意力头参数。

  12. TOOL · CL_180845 ·

    New metric uses eigenvalues to analyze memory dynamics in sequence models

    研究人员引入了一种使用特征值来分析和比较不同序列建模架构(特别是softmax attention和State Space Models (SSMs))的记忆动态的新颖指标。这种方法借鉴了动力学系统理论,提供了一个统一的分析框架,揭示了与任务需求和长程依赖建模相关的谱特征。研究结果表明,特征值分析可以指导架构修改、训练过程,并提供对特征重要性的见解,最终旨在提高序列模型的能力。

  13. RESEARCH · CL_154381 ·

    新的几何框架对五种大型语言模型的Transformer架构进行建模

    研究人员开发了一个连续几何框架来模拟Transformer架构,将离散的代数运算转化为微分几何和测度论。该框架对注意力机制和优化动态等方面进行定量预测,并在包括Qwen3、LLaMA-3.1、Gemma-3、GPT-2和Mistral在内的五种不同模型架构上进行了测试。实验结果与几何预测高度一致,为理解大型语言模型的稳定极限和优化动态提供了新的描述性词汇。

  14. RESEARCH · CL_128381 ·

    序列相关性影响序列模型中的上下文学习

    一篇新的研究论文探讨了数据中的序列相关性如何影响现代序列模型中的上下文学习(ICL)。该研究使用基于线性注意力的可解模型,并在 Transformer 架构上进行测试,确定了两个关键影响。首先,提示中的相关性可以有效缩短上下文长度,使其表现得像更短的独立示例提示。其次,当查询令牌也与上下文相关时,测试误差会降低,特别是与线性注意力相比,对于 softmax 注意力而言,这表明提示相关性会影响给定任务的最佳注意力架构。

  15. RESEARCH · CL_115231 ·

    Flexformer 引入可学习注意力核以实现高效Transformer

    研究人员推出了一种新颖的线性Transformer架构Flexformer,旨在克服传统Transformer的二次复杂度限制。Flexformer通过以数据驱动的方式学习注意力核来实现这一点,利用具有可训练频谱频率的随机傅里叶特征。这种方法具有更强的表达能力,并在语言建模和序列分类任务上展现出优于现有方法的性能。此外,Flexformer可以从预训练Transformer中蒸馏,并有望实现高效的长序列处理。

  16. RESEARCH · CL_108502 ·

    新的 EpiKV 方法优化 LLM KV 缓存,提高效率和上下文长度

    一篇新研究论文介绍了一种名为 EpiKV 的方法,用于优化大型语言模型中的 KV 缓存淘汰。与依赖注意力权重的先前方法不同,EpiKV 使用源自模型内部表征变化的“顿悟分数”。这种方法避免了计算注意力矩阵的需要,能够实现融合内核集成,并显著提高上下文长度的处理能力。实验表明,EpiKV 在 MATH-500 和 AIME-2024 等基准测试中表现与基线相当或更优,同时提供了显著的速度提升。

  17. RESEARCH · CL_109619 ·

    Lifelong AI Learning Needs Parametric Attention in Transformers, Paper Argues

    一项新的研究论文提出,要在 AI 代理中实现终身持续学习,必须在 Transformer 模型中使用参数化形式的注意力。该论文认为,当前注意力机制的二次方复杂度限制了 Transformer 处理任意长序列以进行上下文学习的能力。通过采用参数化注意力(该注意力通过回归在测试时学习键值关系),模型可以保持恒定的内存占用,这与 softmax 注意力等非参数化方法不同。该研究指出了参数化注意力目前的局限性,例如内存容量受限和在线更新成本高…

  18. TOOL · CL_104717 ·

    新研究将 Transformer 路径病理与通用路由机制联系起来

    arXiv 上的一篇新论文提出,像注意力汇聚点(attention sinks)和表征塌陷(representation collapse)这样的常见 Transformer 病理并非注意力机制独有,而是内容路由在固定相似度度量下的固有缺陷。该研究将 softmax 注意力重新定义为欧氏距离上的玻尔兹曼加权聚合,并提出路由与表征不匹配的路由器会导致路由集中并使表征塌陷。这种现象在包括 Transformer、图注意力(graph at…

  19. RESEARCH · CL_84359 ·

    贝叶斯理论解释了Transformer注意力机制中复制头的涌现

    研究人员开发了一种贝叶斯理论来解释Transformer注意力机制中“复制头”的涌现。他们对单层softmax注意力网络的分析揭示了这些注意力模式形成的相变,这种相变取决于训练数据的量。该理论框架为特定子电路的突然出现提供了第一性原理的解释,类似于在大语言模型训练中的观察结果。

  20. TOOL · CL_82518 ·

    模糊窗口注意力提高了Transformer处理长上下文的效率

    研究人员推出了一种新方法——模糊窗口注意力(BLA),旨在提高Transformer语言模型处理长上下文的效率。BLA通过使用狄利克雷核从频率窗口重建模糊的KV历史,解决了标准Softmax注意力的二次复杂度和不断增长的KV缓存大小限制。该方法在滑动窗口注意力方面提供了状态效率的改进,并在需要信息检索的任务上保持了与其他线性注意力模型相当的性能。