Delta rule
PulseAugur coverage of Delta rule — every cluster mentioning Delta rule across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Moonshot AI 发布 Kimi K3,采用新颖内存技术的最大开源模型
Moonshot AI 开发了 Kimi K3,这是一个拥有 3 万亿参数的开源模型,使其成为同类模型中最大的。其创新不仅在于规模,还在于一种名为 Kimi Delta Attention (KDA) 的新颖内存管理系统。KDA 利用“Delta Rule”就地更新内存,显著降低了与长上下文窗口相关的计算成本,这与传统 Transformer 模型随着上下文长度线性增加内存和二次方增加计算量不同。这种方法最初在较小的 Kimi Lin…
-
蚂蚁集团发布 Ling-3.0-Flash,一款拥有1240亿参数的混合AI模型
蚂蚁集团的AI部门发布了Ling-3.0-Flash,这是一款拥有1240亿参数的新型混合推理模型,每次计算激活51亿参数。该模型旨在基础推理、指令遵循和长文本处理等领域匹配或超越其规模两到三倍的模型的性能,提供卓越的“智能效率比”。其设计的关键在于重新设计的计算架构,该架构采用了混合注意力机制和升级的KDA(Kimi Delta Attention)以改进长上下文处理能力。该模型已针对AI代理应用进行了优化,增强了自我纠正和规划能力…
-
新的训练方法提高了循环记忆模型性能
一篇新的研究论文介绍了一种名为“正交化读出”(Orthogonalized Read)的训练技术,旨在提高循环记忆模型的性能。该方法应用于乘法长短期记忆网络(LSTMs)的读出阶段,充当支架,帮助模型更有效地摆脱训练瓶颈。研究表明,该技术具有自洽性,在不同的学习率和难度级别下表现一致,并且可以移除而不影响最终模型的准确性,这表明许多报告的召回基准测试的改进可能与可训练性有关,而非架构改进。
-
NVIDIA 发布 Gated DeltaNet-2 以改进线性注意力
NVIDIA 推出了 Gated DeltaNet-2,这是一种新的线性注意力层,旨在改进循环神经网络中的内存编辑。该模型使用独立的通道门控机制,将擦除旧信息和写入新信息的过程分离开来,解决了先前 delta-rule 架构中的局限性。Gated DeltaNet-2 在 1000 亿 token 和 13 亿参数上进行了训练,在长上下文检索任务上表现优于 Mamba-2 和 KDA 等现有模型。
-
OSDN 通过在线预处理改进线性注意力
研究人员推出了一种新颖的方法 OSDN,该方法通过结合可证明的在线预处理来增强线性注意力机制。该技术通过超梯度反馈在线更新的对角线预处理器来增强 Delta 规则。OSDN 有效地按特征缩放写入端键,在不增加显着开销的情况下保留了 DeltaNet 的高效并行流水线。该方法在上下文内回忆任务中表现出改进的性能,在各种参数规模下均显示出比现有方法显着的优势。