PulseAugur
中
实时 15:58:05
实体 Gated DeltaNet

Gated DeltaNet

PulseAugur coverage of Gated DeltaNet — every cluster mentioning Gated DeltaNet across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
34
90 天内 34
发布 · 30天
0
90 天内 0
论文 · 30天
29
90 天内 29
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 35 条
  1. TOOL · CL_283927 ·

    复杂的KDA实现了线性注意力中的旋转,以进行高级状态跟踪

    研究人员详细介绍了一种名为复杂KDA(CKDA)的新型线性注意力机制,该机制允许在内存更新中进行旋转,从而实现比以往线性模型更复杂的国家跟踪。该机制建立在Moonshot AI的Kimi Linear架构之上,使用带符号门和特定的更新参数来实现这些旋转,这对于计数和跟踪状态至关重要。这项发表在arXiv上的突破表明,CKDA可以表示复杂的有限群,显著增强了线性注意力模型的表达能力。

  2. TOOL · CL_285182 ·

    混合线性注意力提高了长上下文LLM的性能

    研究人员开发了混合线性注意力(HLA),这是一种新颖的注意力机制,旨在提高大型语言模型中的长上下文建模能力。与固定的分块混合方法相比,HLA根据查询动态路由信息,允许更自适应地访问历史数据。当应用于Qwen 3.5模型时,HLA在LongBench-v2和RULER等基准测试中表现出显著的性能提升,并且在从头开始训练场景中也提高了跨越扩展上下文长度的性能。

  3. TOOL · CL_283403 ·

    HLA-WM框架通过改进的远程记忆提升视频世界模型

    研究人员开发了HLA-WM,一个新颖的免训练框架,旨在通过改进长序列的记忆保持能力来增强长视域视频世界模型。该系统通过结合粗粒度几何引导检索和细粒度循环线性状态计算,解决了现有循环线性注意力模型中信息丢失的问题。HLA-WM有效地缓存和检索相关的历史场景信息,在SANA-WM-Bench和MBench-A等基准测试中,PSNR等指标显著提高,旋转误差降低,同时与全KV缓存相比,内存需求也大大降低。

  4. RESEARCH · CL_270698 ·

    新的注意力机制提升长上下文序列建模能力

    两篇新论文介绍了增强循环神经网络长上下文序列建模能力的新方法。第一篇论文“SMat-Attention”提出了结构化矩阵注意力(Structured Matrix Attention),该方法使用结构化因果掩码来实现具有可调复杂度的灵活标记交互,实现了亚二次填充和恒定时间解码。第二篇论文“Triadic Linear Attention”通过使用三元外积创建3D张量状态来泛化线性注意力,显著提高了长上下文语言建模和回忆准确性。

  5. TOOL · CL_268828 ·

    新AI模型AMOR根据预测不确定性选择性使用注意力

    研究人员推出了一种新颖的混合AI架构AMOR(自适应元认知输出路由器),该架构根据预测不确定性选择性地采用注意力机制。这种方法用熵门控注意力块增强了循环骨干网络,这些块仅在模型输出熵超过动态阈值时激活。在FineWeb-Edu数据集上进行测试,采用Mamba2或Gated DeltaNet骨干网络的AMOR变体,在常识推理得分上优于现有的循环、仅注意力以及固定调度的混合模型。该架构还展示了改进的检索性能,并保持了其循环组件的长上下文鲁…

  6. TOOL · CL_280595 ·

    Triadic Linear Attention 增强 RNN 长上下文建模

    研究人员推出了一种新颖的方法——Triadic Linear Attention,它通过利用三阶张量状态来增强循环神经网络(RNN)的记忆状态。该方法通过将键和值的三角外积写入,并通过两个查询从中读取,从而在参数量极少增加的情况下实现了状态大小的 E 倍增长。Triadic Linear Attention 与各种训练技术兼容,并在应用于 Gated DeltaNet 和标量门控线性注意力等模型时,在长上下文语言建模和回忆方面显示出显著改进。

  7. RESEARCH · CL_254534 ·

    SpectralShift 通过谱重参数化增强 Gated DeltaNet 上下文窗口 · 跟踪 2 个来源

    研究人员推出 SpectralShift,一种扩展 Gated DeltaNet (GDN) 模型上下文窗口的新颖方法,该模型利用线性注意力机制。与之前专注于持续预训练的方法不同,SpectralShift 对模型的 alpha 投影进行重参数化以优化其谱特性。该技术通过拓宽慢速频谱带并保留用于上下文切换的快速衰减模式来增强模型检索长距离信息的能力。实验表明,SpectralShift 有效地提高了 GDN 的长上下文能力,为扩展其上…

  8. TOOL · CL_228892 ·

    新的DASC方法将AI模型状态压缩率提高2.63倍

    研究人员开发了衰减感知状态压缩(DASC)方法,这是一种优化混合线性注意力模型服务的新颖方法。DASC分析不同模型组件的保留时间尺度,识别哪些状态部分可以在不显著损失质量的情况下进行压缩。通过选择性地存储和打包长时程状态单元,DASC可以将循环状态检查点的内存使用量减少高达2.63倍。这种压缩带来了推理速度的显著提升,包括平均首次令牌时间(Time to First Token)减少42.6%,以及输入吞吐量增加68.4%。

  9. TOOL · CL_228886 ·

    Tail-Replay 提升混合 LLM 推理速度,实现无约束的前缀重用

    研究人员推出了一种新颖的前缀缓存机制 Tail-Replay,旨在提高混合大型语言模型(LLM)的效率。这些模型结合了全注意力(full-attention)和线性注意力(linear-attention)层来处理长上下文,但传统的前缀缓存难以处理这些层不同的状态管理。Tail-Replay 通过重放匹配前缀的短后缀来近似线性注意力状态,从而消除了对循环状态检查点的需求。这种方法实现了无约束的 token 级前缀重用,并在 LongB…

  10. TOOL · CL_227089 ·

    DAMP新技术大幅降低LLM内存使用并提升速度

    研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…

  11. RESEARCH · CL_229109 ·

    Qwen3.8-Flash-Next 架构详解,效率和稳定性有所提升 · 已追踪 2 个来源

    研究人员详细介绍了 Qwen3.8-Flash-Next 的架构,这是一个拥有 125B 参数的稀疏专家混合模型。与前代 397B-A17B 模型相比,该新模型通过激活参数、训练 token 和 FLOPs 的一小部分,展示了更高的效率和稳定性。关键创新包括混合注意力机制、门控残差网络以及加速器外的 n-gram 嵌入,这些共同提升了性能和训练动态。

  12. SIGNIFICANT · CL_219953 ·

    Qwen3.8-Flash-Next-FP8 VLM 拥有 125B 参数和 Gated DeltaNet

    Qwen3.8-Flash-Next-FP8 是一个拥有 1250 亿参数的 VLM,它使用了 60 亿激活 MoE 单元和 Gated DeltaNet 架构。此 FP8 版本分布在 131 个 safetensors 分片中,并支持思考模式和代理控制等高级功能。

  13. FRONTIER RELEASE · CL_219957 ·

    阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型

    阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…

  14. SIGNIFICANT · CL_217028 ·

    阿里巴巴 Qwen3.8-27B 采用混合注意力技术,实现高效长上下文处理

    阿里巴巴通义实验室发布了 Qwen3.8-27B,这是一款拥有 277.8 亿参数的多模态模型,采用了新颖的混合注意力架构。该设计通过一种名为 Gated DeltaNet 的线性注意力机制,策略性地将每四层注意力中的三层替换掉,仅保留关键层使用全注意力。这种方法显著降低了内存压力和计算成本,使模型能够处理 262,144 个 token 的原生上下文窗口,并通过 YaRN 缩放可扩展至约一百万个 token,同时还能容纳在一块高端消…

  15. TOOL · CL_215893 ·

    新的 TreeWY 方法增强了混合 AI 模型的推测性验证

    研究人员开发了一种名为 TreeWY 的新方法,用于门控 DeltaNet 混合模型的推测性验证。该技术无需对循环状态进行内存密集型快照,而是使用树状变换来计算草稿节点输出。在 Qwen3.5 模型上的基准测试表明,TreeWY 减少了内存压力并提高了吞吐量,尤其是在内存是瓶颈时,对首次令牌生成时间(time-to-first-token)有所改善。

  16. SIGNIFICANT · CL_209509 ·

    阿里巴巴的 Qwen3.8-27B 集成视觉与语言能力,可与更大模型媲美

    阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一款集成了视觉和语言能力的新型开放权重模型。该模型拥有 262,144 个 token 的超长上下文窗口,可扩展至 100 万,并具备灵活的思维控制能力。基准测试表明,Qwen3.8-27B 在编码和智能体任务上超越了其前代模型,甚至可以与更大的闭源模型相媲美,同时在多模态推理方面也表现出色。

  17. SIGNIFICANT · CL_200541 ·

    Alibaba 发布拥有 2.4T 参数的开放权重 Qwen3.8-Max

    Alibaba 发布了 Qwen3.8-2.4T-A95B,这是其 Qwen-Max 系列首次采用开放权重发布。该新模型拥有 2.4 万亿总参数,每次前向传播有 950 亿活跃参数,采用了 Gated DeltaNet 和标准注意力机制的混合架构。Qwen3.8-Max 在各种基准测试中表现强劲,尤其在 PaperBench 的学术理解和编码任务方面表现出色,同时还提供具有竞争力的价格,每百万 token 输入/输出分别为 2 美元/6 美元。

  18. RESEARCH · CL_191303 ·

    新的模块化TTT框架简化了测试时训练设计

    研究人员推出了一种名为Modular TTT的新框架,旨在简化测试时训练(TTT)方法的创建和分析。该框架将内部学习过程表示为有向无环图,允许明确定义和操作诸如快速权重网络、损失函数和学习率等组件。通过使用Modular TTT进行的系统消融研究,研究人员发现特定配置(如小学习率和权重衰减)可以提高性能,而更深的网络和归一化可能会产生不利影响。这些见解促使训练出大型模型,其性能可与现有的最先进模型(如Gated DeltaNet)相媲美。

  19. TOOL · CL_180518 ·

    新的TTCD框架在推理过程中增强长上下文语言模型

    研究人员推出了一种名为测试时上下文蒸馏(TTCD)的新型长上下文语言建模框架,该框架可在推理过程中优化参数更新。与以往的方法不同,TTCD引入了一个自监督目标,以策略性地分配有限的内存容量来存储未来可能相关的信息。实验表明,TTCD,特别是其就地变体(IP-TTCD),在长上下文语言建模任务中优于DeltaNet和滑动窗口注意力等现有方法。该方法使预训练的Transformer模型能够在推理过程中持续适应其参数,从而以最小的架构更改获…

  20. COMMENTARY · CL_171584 ·

    理解 Moonshot AI 的 Kimi K3 模型架构指南

    一篇 Reddit 帖子概述了理解 Moonshot AI 的 Kimi K3 模型推荐的阅读顺序。建议的顺序首先从线性 Transformer 和门控 Delta 机制的基础论文开始,然后进展到 Kimi 自家的 Kimi Delta Attention (KDA) 架构。接着深入探讨具有 LatentMoE 和 Stable LatentMoE 的专家混合 (MoE) 设计的进展,然后是用于改进信息流的注意力残差概念。帖子最后建议…