Gated DeltaNet
PulseAugur coverage of Gated DeltaNet — every cluster mentioning Gated DeltaNet across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新的 TreeWY 方法增强了混合 AI 模型的推测性验证
研究人员开发了一种名为 TreeWY 的新方法,用于门控 DeltaNet 混合模型的推测性验证。该技术无需对循环状态进行内存密集型快照,而是使用树状变换来计算草稿节点输出。在 Qwen3.5 模型上的基准测试表明,TreeWY 减少了内存压力并提高了吞吐量,尤其是在内存是瓶颈时,对首次令牌生成时间(time-to-first-token)有所改善。
-
阿里巴巴的 Qwen3.8-27B 集成视觉与语言能力,可与更大模型媲美
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一款集成了视觉和语言能力的新型开放权重模型。该模型拥有 262,144 个 token 的超长上下文窗口,可扩展至 100 万,并具备灵活的思维控制能力。基准测试表明,Qwen3.8-27B 在编码和智能体任务上超越了其前代模型,甚至可以与更大的闭源模型相媲美,同时在多模态推理方面也表现出色。
-
Alibaba 发布拥有 2.4T 参数的开放权重 Qwen3.8-Max
Alibaba 发布了 Qwen3.8-2.4T-A95B,这是其 Qwen-Max 系列首次采用开放权重发布。该新模型拥有 2.4 万亿总参数,每次前向传播有 950 亿活跃参数,采用了 Gated DeltaNet 和标准注意力机制的混合架构。Qwen3.8-Max 在各种基准测试中表现强劲,尤其在 PaperBench 的学术理解和编码任务方面表现出色,同时还提供具有竞争力的价格,每百万 token 输入/输出分别为 2 美元/6 美元。
-
新的模块化TTT框架简化了测试时训练设计
研究人员推出了一种名为Modular TTT的新框架,旨在简化测试时训练(TTT)方法的创建和分析。该框架将内部学习过程表示为有向无环图,允许明确定义和操作诸如快速权重网络、损失函数和学习率等组件。通过使用Modular TTT进行的系统消融研究,研究人员发现特定配置(如小学习率和权重衰减)可以提高性能,而更深的网络和归一化可能会产生不利影响。这些见解促使训练出大型模型,其性能可与现有的最先进模型(如Gated DeltaNet)相媲美。
-
新的TTCD框架在推理过程中增强长上下文语言模型
研究人员推出了一种名为测试时上下文蒸馏(TTCD)的新型长上下文语言建模框架,该框架可在推理过程中优化参数更新。与以往的方法不同,TTCD引入了一个自监督目标,以策略性地分配有限的内存容量来存储未来可能相关的信息。实验表明,TTCD,特别是其就地变体(IP-TTCD),在长上下文语言建模任务中优于DeltaNet和滑动窗口注意力等现有方法。该方法使预训练的Transformer模型能够在推理过程中持续适应其参数,从而以最小的架构更改获…
-
理解 Moonshot AI 的 Kimi K3 模型架构指南
一篇 Reddit 帖子概述了理解 Moonshot AI 的 Kimi K3 模型推荐的阅读顺序。建议的顺序首先从线性 Transformer 和门控 Delta 机制的基础论文开始,然后进展到 Kimi 自家的 Kimi Delta Attention (KDA) 架构。接着深入探讨具有 LatentMoE 和 Stable LatentMoE 的专家混合 (MoE) 设计的进展,然后是用于改进信息流的注意力残差概念。帖子最后建议…
-
Kimi Delta Attention 解析:从二次到线性变体
本文深入探讨了 Kimi Delta Attention (KDA) 机制,这是一种复杂的线性注意力变体。文章追溯了从二次注意力到 KDA 的演变过程,解释了 KDA 如何通过关注误差校正而非直接值更新来解决早期线性注意力模型的局限性。解释中使用了 bra-ket 符号和数学推导来说明该过程,并强调了其在 Qwen 和 Kimi 等现代模型中的应用。
-
Kernelized Linear Attention Boosts Model Capacity and Throughput
研究人员开发了 Kernelized Linear Attention Activations (KATA),一个旨在克服线性注意力模型容量限制的新框架。KATA 利用对称锥和秩一正半定特征来提高联想回忆和状态容量,而无需增加参数。通过融合的 Triton 内核实现,KATA 在处理长序列时,展示出比 FlashAttention-2 高得多的吞吐量,并在需要长距离依赖和精确回忆的任务上,表现出与 Gated DeltaNet 等模型…
-
新研究探索统一路由以实现自适应 LLM 效率 · 跟踪 2 个来源
两篇新研究论文探讨了通过根据令牌复杂度动态调整计算资源来优化大型语言模型效率的方法。第一篇论文《线性注意力架构》比较了各种线性注意力机制,发现 Kimi Delta Attention with Muon 的验证损失最低,而纯 Gated DeltaNet 堆栈的训练吞吐量最高。这项工作还引入了跨层值路由(CLVR)来提高性能。第二篇论文《TriRoute》提出了一个统一的学习路由系统,该系统为每个令牌联合调整注意力分辨率、专家选择和…
-
稀疏增量记忆提升线性RNN,实现更好的长上下文记忆
研究人员推出了一种名为稀疏增量记忆(Sparse Delta Memory, SDM)的新型架构,旨在增强线性循环神经网络(RNN)的长上下文记忆能力。通过采用稀疏寻址方案,SDM显著提高了门控线性RNN的隐藏状态容量,在相似的计算约束下,其在上下文学习和长上下文检索任务上的表现优于传统的Transformer架构。该架构通过对显式内存进行稀疏读写来扩展门控增量网络(Gated DeltaNet),并且当其初始状态被参数化学习时,还能…
-
Gated DeltaNet 通过 delta 规则和遗忘门提升高效 VLM 内存
研究人员详细介绍了 Gated DeltaNet,这是一种高效视觉语言模型(VLM)的新方法,它采用具有固定大小内存矩阵的线性时间递归。该方法由 MIT 和 NVIDIA 的 Yang 等人开发,通过采用 delta 规则进行纠错写入和学习到的遗忘门,解决了传统 Transformer 和其他线性注意力模型的局限性。Gated DeltaNet 在完美跟踪排列方面表现出独特的能力,在该特定任务上优于 Mamba-3 等模型,这对于处理…
-
Olmo Hybrid语言模型展现出改进的可扩展性和表达能力
研究人员推出Olmo Hybrid,一款结合了循环和注意力机制的新的70亿参数语言模型。这种混合架构采用Gated DeltaNet层,与传统的Transformer及其前身Olmo 3相比,展现出更优越的性能和更高效的可扩展性。该研究从理论和实践上证明,Olmo Hybrid能够执行超越纯粹Transformer和线性RNN的任务,包括代码执行,预示着语言模型发展的一个有前景的新方向。
-
新的Taylor-Calibrate方法改进了Transformer到线性注意力模型的转换
研究人员开发了Taylor-Calibrate,一种旨在改进Transformer模型到混合线性注意力模型转换的新初始化方法。该技术通过提供一种原则性的方法来设置新的动态参数,解决了将预训练Transformer转换为Gated DeltaNet学生的脆弱性问题。该方法利用Taylor引导的教师注意力统计数据来配置值投影、记忆时间尺度和门控动态,从而产生更强的零样本学生模型,并且需要更少的蒸馏token即可有效转换。
-
xLSTM 在序列建模任务中优于 Mamba-2 和 DeltaNet
一篇新的研究论文比较了三种亚二次方架构——xLSTM、Mamba-2 和 Gated DeltaNet——在序列建模任务上的表现。研究发现,在代码模型预训练、蒸馏和时间序列基础模型方面,xLSTM 的表现优于其他模型。研究人员将 xLSTM 的卓越性能归因于其通过门控方案实现的灵活且稳定的记忆校正能力,从而能够进行稳健的状态跟踪和累积。
-
动态卷积提升LLM中Transformer的性能
研究人员引入了动态短卷积作为一种新的基元,以增强大型语言模型中使用的Transformer架构。这些动态卷积利用输入相关的滤波器,在保持传统卷积的局部性偏差的同时,提高了表达能力。实验表明,在各种参数规模下,与标准Transformer和静态卷积变体相比,性能持续提高,这表明在计算优势和推进基于Transformer的语言模型方面具有潜力。
-
新框架使用贝叶斯记忆统一序列模型
研究人员引入了一个“设计-模型”框架,用于基于记忆假设创建高效的循环序列映射。该框架使用贝叶斯滤波将证据写入记忆,并使用依赖于查询的读出进行预测。他们的“贝叶斯层”实例化跟踪存储关联中的不确定性,提高了记忆保持和检索的鲁棒性。
-
新的国际象棋基准暴露 Transformer 的状态追踪缺陷
研究人员推出了 Chess-World-Model,这是一个旨在评估世界模型状态追踪能力的新基准。该基准利用了包含 1000 万局国际象棋比赛的数据集,以测试模型在走完一系列棋步后预测精确棋盘状态的能力。研究发现,循环神经网络架构(如 SLiCE、Mamba-3 和 Gated DeltaNet)在此任务上的表现显著优于传统 Transformer,尤其是在处理随机对弈产生的分布外数据时。研究强调,模型规模本身并不能保证状态追踪性能的…
-
新的Oryx模型灵活地在Attention和Recurrent Mixers之间切换
研究人员推出了一种新颖的混合模型Oryx,该模型能够灵活地在给定序列中不同序列混合器(如二次Attention和线性循环)之间进行切换。这种方法允许通过Attention实现丰富的上下文利用,通过线性循环实现高效生成,同时跨模式共享超过90%的参数。通过Mamba-2和Gated DeltaNet变体(高达1.4B模型)进行的验证表明,Oryx在语言建模任务上取得了与单一混合器基线相当或更优的性能,并在检索任务上以显著更少的Atten…
-
PapersWithCode 增加多指标排行榜和外部论文支持
Hugging Face 为 PapersWithCode(一个跟踪人工智能最新进展的平台)推出了新功能。更新包括支持排行榜上的多个指标,例如自动语音识别和目标检测。该平台现在还支持 arXiv 以外的外部论文,自动为其添加相关标签和数据,并显示论文的演变过程,以展示后续或先前的研究。
-
WriteSAE 可直接操控循环语言模型状态
研究人员开发了 WriteSAE,这是一种新颖的稀疏自编码器,旨在操控循环语言模型状态内的矩阵更新。该方法学习秩-1 矩阵原子,直接替换模型自身的矩阵更新,在最终标记分布准确性方面显示出显著的改进。该技术已成功应用于 Gated DeltaNet 和 Mamba-2 等模型,展示了其在引导模型生成和理解内部状态动态方面的潜力。