PulseAugur
实时 10:14:15
实体 DeltaNet

DeltaNet

PulseAugur coverage of DeltaNet — every cluster mentioning DeltaNet across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 7
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_259382 ·

    研究发现寄生路径阻碍 RNN 状态跟踪

    一篇新研究论文提出了 Householder 线性 RNN 中“加性输入路径”的概念,并将其识别为阻碍状态跟踪的寄生吸引子。当移除此路径时,相同的架构能够学习并泛化到更长的序列,在某些任务上达到完美的准确率。该研究表明,加性路径会破坏并隐藏正确的自动机学习,实验表明,在禁用此路径的情况下初始化模型可以实现精确泛化。

  2. RESEARCH · CL_206625 ·

    Nexus模型提供与SDXL相当的高效文本到图像生成

    研究人员推出了一种新颖的文本到图像生成模型Nexus,旨在提高效率。Nexus集成了稀疏架构、线性复杂度和低比特量化,结合了MoE前馈层和门控DeltaNet注意力。这种方法使Nexus在生成质量上可与SDXL和Stable Diffusion 3等成熟模型相媲美,同时显著提高了推理速度并降低了内存需求。在COCO和Laion数据集上进行的实验验证了其有效性。

  3. SIGNIFICANT · CL_200925 ·

    Qwen3.8-27B-FP8多模态模型发布,采用Gated-DeltaNet架构

    名为Qwen3.8-27B-FP8的新多模态模型已发布。该模型能够进行图像-文本-到-文本生成,并采用混合Gated-DeltaNet/Gated-Attention架构。它包含64层、270亿参数,并使用FP8量化进行推理。该模型的推理工作量可通过低、中或高设置进行控制。

  4. TOOL · CL_180518 ·

    新的TTCD框架在推理过程中增强长上下文语言模型

    研究人员推出了一种名为测试时上下文蒸馏(TTCD)的新型长上下文语言建模框架,该框架可在推理过程中优化参数更新。与以往的方法不同,TTCD引入了一个自监督目标,以策略性地分配有限的内存容量来存储未来可能相关的信息。实验表明,TTCD,特别是其就地变体(IP-TTCD),在长上下文语言建模任务中优于DeltaNet和滑动窗口注意力等现有方法。该方法使预训练的Transformer模型能够在推理过程中持续适应其参数,从而以最小的架构更改获…

  5. TOOL · CL_168772 ·

    Kimi Delta Attention 解析:从二次到线性变体

    本文深入探讨了 Kimi Delta Attention (KDA) 机制,这是一种复杂的线性注意力变体。文章追溯了从二次注意力到 KDA 的演变过程,解释了 KDA 如何通过关注误差校正而非直接值更新来解决早期线性注意力模型的局限性。解释中使用了 bra-ket 符号和数学推导来说明该过程,并强调了其在 Qwen 和 Kimi 等现代模型中的应用。

  6. TOOL · CL_167502 ·

    Reverso:用于零样本预测的高效时间序列基础模型

    研究人员开发了Reverso,这是一个新的高效时间序列基础模型系列,专为零样本预测而设计。与依赖大型Transformer和数亿参数的先前模型不同,Reverso采用了更小的混合模型,该模型交织了卷积层和线性RNN层。这些更紧凑的模型,例如DeltaNet,可以实现与大型模型相当的性能,同时效率更高且成本效益更高。该开发还结合了数据增强和推理策略,以进一步增强预测能力。

  7. RESEARCH · CL_133496 ·

    新研究探索统一路由以实现自适应 LLM 效率 · 跟踪 2 个来源

    两篇新研究论文探讨了通过根据令牌复杂度动态调整计算资源来优化大型语言模型效率的方法。第一篇论文《线性注意力架构》比较了各种线性注意力机制,发现 Kimi Delta Attention with Muon 的验证损失最低,而纯 Gated DeltaNet 堆栈的训练吞吐量最高。这项工作还引入了跨层值路由(CLVR)来提高性能。第二篇论文《TriRoute》提出了一个统一的学习路由系统,该系统为每个令牌联合调整注意力分辨率、专家选择和…

  8. TOOL · CL_104751 ·

    新的解码器架构在中小型代码模型中显示出改进的保留能力

    研究人员开发了SamatNext v0.2-B,这是一种3.56亿参数的混合序列解码器,旨在减轻中小代码模型在顺序微调过程中遗忘的问题。该实验模型在差分注意力风格层和简化的线性状态混合器层之间交替,采用RMS归一化和输出尺度校准。在受控的Python代码课程实验中,与Transformer基线相比,SamatNext v0.2-B在后续阶段表现出更优越的早期训练阶段保留能力,在后期阶段达到100.0%的通过率,同时保留了98.8%的相邻语义行为。

  9. RESEARCH · CL_62204 ·

    新框架使用贝叶斯记忆统一序列模型

    研究人员引入了一个“设计-模型”框架,用于基于记忆假设创建高效的循环序列映射。该框架使用贝叶斯滤波将证据写入记忆,并使用依赖于查询的读出进行预测。他们的“贝叶斯层”实例化跟踪存储关联中的不确定性,提高了记忆保持和检索的鲁棒性。

  10. RESEARCH · CL_34499 ·

    新的注意力方法应对大语言模型长上下文挑战

    研究人员正在开发新的注意力机制来处理大型语言模型中日益增长的长上下文。一种方法,Runtime-Certified Bounded-Error Quantized Attention,使用分层 KV 缓存来压缩内存,同时保证回退到精确注意力,确保语言建模和检索等任务的质量。另一种方法,DashAttention,采用可微分稀疏分层注意力来适应性地选择相关 token,以与全注意力相当的准确性实现高稀疏度,并提供优于现有分层方法的性能。…