PulseAugur
中
实时 20:59:12
实体 linear attention

linear attention

PulseAugur coverage of linear attention — every cluster mentioning linear attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
33
90 天内 33
发布 · 30天
0
90 天内 0
论文 · 30天
31
90 天内 31
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/2 页 · 共 34 条
  1. RESEARCH · CL_271021 ·

    新研究提高了线性注意力的效率和性能

    研究人员正在开发新方法来提高大型语言模型中线性注意力机制的效率和性能。一种方法,Switching Linear Attention (SwiLA),在保持固定大小的循环状态的同时增强了表示能力,与标准 softmax 注意力相比,取得了有竞争力的结果。另一项开发,LeapQuant,专注于线性注意力的精确循环状态量化,在推理中实现了显著的加速,且质量损失很小。此外,对线性注意力的理论分析表明,其循环状态通常具有低秩结构,这表明通过基…

  2. RESEARCH · CL_270698 ·

    新的注意力机制提升长上下文序列建模能力

    两篇新论文介绍了增强循环神经网络长上下文序列建模能力的新方法。第一篇论文“SMat-Attention”提出了结构化矩阵注意力(Structured Matrix Attention),该方法使用结构化因果掩码来实现具有可调复杂度的灵活标记交互,实现了亚二次填充和恒定时间解码。第二篇论文“Triadic Linear Attention”通过使用三元外积创建3D张量状态来泛化线性注意力,显著提高了长上下文语言建模和回忆准确性。

  3. RESEARCH · CL_254534 ·

    SpectralShift 通过谱重参数化增强 Gated DeltaNet 上下文窗口 · 跟踪 2 个来源

    研究人员推出 SpectralShift,一种扩展 Gated DeltaNet (GDN) 模型上下文窗口的新颖方法,该模型利用线性注意力机制。与之前专注于持续预训练的方法不同,SpectralShift 对模型的 alpha 投影进行重参数化以优化其谱特性。该技术通过拓宽慢速频谱带并保留用于上下文切换的快速衰减模式来增强模型检索长距离信息的能力。实验表明,SpectralShift 有效地提高了 GDN 的长上下文能力,为扩展其上…

  4. RESEARCH · CL_242975 ·

    Kalman Delta Networks 通过不确定性感知记忆增强语言模型

    研究人员推出了一种名为 Kalman Delta Networks (KDNs) 的新型模型系列,旨在通过引入不确定性感知来增强语言模型中的联想记忆。这些网络将循环联想记忆重新构建为线性高斯状态空间模型,利用卡尔曼滤波器最优地估计记忆状态及其不确定性。KDNs 允许更新根据累积证据和观测可靠性进行调整,改进了现有缺乏显式置信度跟踪的 Delta-rule 模型。开发了两种兼容扫描的近似方法:Diagonal KDN 和 Isotrop…

  5. TOOL · CL_235558 ·

    新的混合Transformer架构提高了长上下文外推能力

    研究人员开发了一个名为Head-wise Hybrid Architecture (HwH)的新框架,重新评估了现代Transformer的设计。通过使用RoPE Frequency Importance Score (RFIS)和RoPE Positional Dependence (RPD)等指标分析头级别的函数组织,他们识别出检索头和位置头之间的清晰分离。该分析表明,位置建模应该是局部的,通过与位置无关的检索实现全局访问,并且这…

  6. TOOL · CL_229571 ·

    研究发现视频世界模型难以追踪隐藏状态

    研究人员调查了视频世界模型在追踪未观察到的状态时的局限性,即使它们表现出很高的视觉保真度。使用“猜杯游戏”任务,他们发现像双向和自回归Transformer、Mamba和线性注意力模型在超过一定数量的交换后难以进行外推,这表明它们没有维持世界的隐藏状态。研究表明,基于像素的扩散目标并不能监督看不见的隐藏状态,迫使模型从历史中重新推导排列。然而,研究确定了两种可以进行外推的机制:具有负转移特征值的线性注意力以及TTT中的非线性快速权重机…

  7. RESEARCH · CL_229538 ·

    新的arXiv论文总结了深度估计的进展并引入了新颖的扩散模型

    两篇新的arXiv论文探讨了单目深度估计的进展,这是一项基础的计算机视觉任务。第一篇论文对该领域进行了全面调查,追溯了其从早期方法到像DINOv3这样的基础模型的影响及其在机器人和自动驾驶等领域的应用。第二篇论文介绍了Lapis,一个利用线性注意力和像素空间扩散实现高效、高保真度深度估计的新颖框架,以显著缩短的推理时间实现了最先进的准确性。

  8. RESEARCH · CL_227050 ·

    滑动窗口注意力在大型语言模型中优于线性注意力

    一篇新的研究论文表明,带有注意力汇聚点的滑动窗口注意力(SWA)在大型语言模型(LLMs)上的表现与线性注意力模型相当或更优。这项发表在arXiv上并由Hugging Face重点介绍的研究发现,SWA在长上下文推理任务(如Needle-in-a-Haystack和BABILong)上显著优于线性注意力,性能提高了2到10倍。SWA为LLM推理提供了一种更高效、更具成本效益的解决方案,无需训练后调整,内存占用低,速度快,使其成为线性注…

  9. FRONTIER RELEASE · CL_220173 ·

    Z.ai 发布 GLM-5.3-Flash,一款拥有 100 万 token 上下文的多模态 MoE 模型

    Z.ai 推出了 GLM-5.3-Flash,这是一款原生多模态的混合专家(MoE)模型,拥有 3200 亿总参数和每个 token 180 亿激活参数。该模型拥有 100 万 token 的上下文窗口,支持图像和视频输入,并以 MIT 许可证发布,权重可在 Hugging Face 上获取。据报道,它在编码基准测试中优于其前身 GLM-5.2,在编码任务中可与 Claude Opus 4.8 相媲美,同时运营成本显著降低。该模型的效…

  10. TOOL · CL_218269 ·

    新方法使 Vision Transformers 适应更快的物体检测

    研究人员开发了一种名为 Detector-Interface Distillation (DiD) 的新方法,将 Vision Transformers (ViTs) 从 Softmax 注意力适配到线性注意力,用于物体检测任务。这种无标签的方法侧重于保留检测器的预期特征张量,而不仅仅是模仿内部状态,从而在 DOTA-v1.5 等数据集上实现了显著的性能提升。适配过程速度很快,大约需要 87 分钟完成,推理延迟减少了约 62%,峰值内…

  11. RESEARCH · CL_202816 ·

    新的QED方法增强了线性注意力模型的长程记忆能力

    一篇新的研究论文介绍了一种名为查询派生擦除方向(QED)的方法,用于提高线性注意力模型的长程记忆能力。QED增加了一个源自查询的第二个擦除方向,该方向与键正交,有助于抵消旧的状态内容。这种方法旨在解决干扰问题,这些问题会降低线性注意力模型中的检索性能,尤其是在长上下文长度下。该论文提出QED可以显著提高可用上下文长度和检索准确性。

  12. COMMENTARY · CL_190013 ·

    KV 缓存成为 LLM 瓶颈,推动注意力变体创新

    KV 缓存是 LLM 自回归解码的关键组成部分,被确定为 2026 年前沿模型的主要瓶颈。其大小随上下文长度和批处理大小线性增长,使其成为比模型权重更主要的内存消耗者。缓解此瓶颈的技术包括减少 KV 头(MQA、GQA)、使用潜在表示压缩缓存(MLA)以及通过线性注意力或状态空间模型(SSMs)完全消除不断增长的缓存。2026 年的主流方法是混合模型,它将全注意力层与线性/SSM 层交织在一起,以平衡质量和内存效率。

  13. TOOL · CL_167862 ·

    Panda框架实现了盆腔MRI的实时无监督异常检测

    研究人员开发了一个名为Panda的新型无监督异常检测框架,专为实时盆腔MRI成像设计。该系统利用一个冻结的DINOv3 Vision Transformer编码器和一个带有线性注意力解码器的嘈杂MLP瓶颈,在无需标记数据的情况下识别与正常组织表示的偏差。Panda生成空间异常图和帧级分数,在子宫肌瘤数据集上实现了88.06%的AUROC,并以40.5切片/秒的速度运行,满足了为放射科医生提供即时反馈的临床部署要求。

  14. TOOL · CL_156499 ·

    论文解释了为何相对位置编码能提升 Transformer 的泛化能力

    一篇新论文提出了一个基于优化的解释,说明为何具有相对位置编码的 Transformer 比具有绝对编码的 Transformer 在泛化到更长序列时表现更好。研究表明,梯度下降的隐式偏差在使用 Rotary Encodings 时倾向于有利于对相对位置具有等变性的解,从而在不同序列长度下实现一致的性能。相比之下,绝对编码倾向于记忆特定位置,阻碍了外插。该研究通过在最小检索任务和全序列长度泛化任务上的实验证实了这些发现,并指出线性注意力…

  15. RESEARCH · CL_154325 ·

    新方法应对大语言模型长上下文效率挑战 · 跟踪 3 个来源

    研究人员正在开发新方法来提高大语言模型长上下文推理的效率。一种名为 LISA 的方法将线性注意力与稀疏注意力机制相结合,将计算复杂度从 O(n^2) 降低到 O(nM),在某些模型上实现了 50% 的推理速度提升。另一种方法 ELSAA 使用稀疏和低秩分支来近似注意力分数,从而能够在不具体化完整注意力矩阵的情况下进行更长上下文的训练。第三篇论文 Lil 探讨了稀疏注意力可能由于序列更长而导致复杂性增加的“少即是少”问题,并提出了一种提…

  16. TOOL · CL_153697 ·

    新方法使用稀疏嵌入改进冷门商品推荐

    研究人员开发了一种新方法,通过利用稀疏嵌入而非传统的密集向量来改进大规模数字平台中的冷门商品推荐。该方法解决了推荐缺乏历史用户交互数据的新增商品所面临的挑战。所提出的技术包括一种受线性注意力启发的预稀疏化激活方法,它增强了商品-商品相似性的锐度和去噪能力,从而提高了准确性并降低了存储成本。

  17. TOOL · CL_129801 ·

    HOLA 为线性注意力模型增强了互补记忆系统

    研究人员开发了一种名为 HOLA(海马体线性注意力)的新方法,以增强线性注意力和状态空间语言模型的记忆能力。该方法引入了一个互补的“海马体”组件,用于存储精确的键值关联,解决了传统循环状态可能覆盖早期事实的损失性质。HOLA 在有界精确缓存旁边维护一个压缩记忆,从而能够高效存储线性可压缩结构,同时保留关键关联。这种半参数记忆系统在 Wikitext 和 LAMBADA 基准测试中的困惑度方面取得了显著改进,并在“针尖麦芒”召回测试中表…

  18. RESEARCH · CL_128381 ·

    序列相关性影响序列模型中的上下文学习

    一篇新的研究论文探讨了数据中的序列相关性如何影响现代序列模型中的上下文学习(ICL)。该研究使用基于线性注意力的可解模型,并在 Transformer 架构上进行测试,确定了两个关键影响。首先,提示中的相关性可以有效缩短上下文长度,使其表现得像更短的独立示例提示。其次,当查询令牌也与上下文相关时,测试误差会降低,特别是与线性注意力相比,对于 softmax 注意力而言,这表明提示相关性会影响给定任务的最佳注意力架构。

  19. TOOL · CL_122997 ·

    新的HOLA架构通过双记忆系统增强线性注意力语言模型

    研究人员开发了HOLA(海马体线性注意力)架构,这是一种通过引入互补记忆系统来增强线性注意力语言模型的新型架构。该系统解决了标准线性注意力模型中信息丢失的问题,在这些模型中,由于固定大小的循环状态,早期事实可能会被覆盖。HOLA在保持压缩状态的同时,增加了精确的KV缓存来存储关键关联,从而提高了召回率并降低了困惑度。

  20. TOOL · CL_118004 ·

    新的键相关层注意力为神经网络提供线性复杂度

    研究人员开发了一种新颖的机制——键相关层注意力(KCLA),旨在改进神经网络中不同层之间的交互方式。KCLA通过实现线性复杂度来解决传统层注意力的二次计算复杂度问题,其灵感来源于对层注意力中键表示显示出高余弦相似性的观察。这种新方法保持了动态信息更新和有效的长距离跨层依赖性,性能优于循环层注意力和线性注意力等现有方法。KCLA在图像识别、物体检测和医学图像分割等各种应用中表现出色,并且其代码已公开提供。