Mamba-2
PulseAugur coverage of Mamba-2 — every cluster mentioning Mamba-2 across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
NVIDIA发布具有100万上下文的Nemotron-Labs-Teacher模型 · 跟踪4个来源
NVIDIA发布了一系列Nemotron-Labs-Teacher模型,每个模型拥有5500亿参数,但只有550亿参数被激活使用。这些模型采用了包含Mamba-2、MoE和多Token预测的LatentMoE架构,支持高达100万Token的上下文窗口。这些模型在OpenMDW-1.1许可下可用,并且需要大量的硬件支持,例如4块B200/GB200或8块H100 GPU才能运行。
-
英伟达的 NeMo Switchyard 将 AI 代理成本降低 74%,盖过了其新模型发布
英伟达发布了两项新技术:Nemotron 3.5 Lightning,一个开源权重语言模型;以及 NeMo Switchyard,一个用于 AI 代理的开源路由库。虽然 Nemotron 3.5 Lightning 是一个标准的 30B 参数模型,但 NeMo Switchyard 因其显著降低 AI 代理成本的潜力而备受关注。早期基准测试表明,NeMo Switchyard 可通过智能路由请求至更便宜的模型,将大部分调用避开昂贵的尖…
-
状态空间模型:从S4到Mamba的综述
本文全面回顾了结构化状态空间模型(SSMs),追溯了它们从最初的S4架构到Mamba和Mamba-2等更先进模型的演进。文章分析了输入依赖选择性、循环和卷积视图之间的相互作用、对角化和缓存机制等关键设计维度。该回顾强调了SSMs在长上下文场景下的效率和有效性,使其成为Transformer的有力竞争替代品,同时也承认了Transformer在需要精确检索的任务中的优势。
-
新的 nGPT 训练方法将 MoE 模型所需的 token 数量减半
研究人员开发了一种名为归一化 Transformer (nGPT) 的新训练方法,该方法将模型参数和激活限制在单位超球面上,以改进表示学习。这一方法在最近的 arXiv 论文中进行了详细介绍,包括 Logit Gradient Preconditioning、Logarithmic Learning Rate Decay 和 GatedAdamW 等技术。当应用于混合 Mamba-2--Transformer Mixture-of-E…
-
DART架构通过融合Transformer和SSM来增强长上下文序列建模
研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。
-
JAXBench 推出以优化 Google TPU 上的 AI 内核
一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。
-
新仪器精确测量 Mamba 模型状态使用情况和输入驱动迁移
研究人员开发了一种新仪器,可以精确测量选择性状态空间模型(如 Mamba)如何利用其内部模式。该工具能够精确量化模式对模型输出的贡献,从而能够预测因丢弃特定模式而产生的错误。对 Mamba 系列(包括 Mamba-1、Mamba-2 和 Falcon-Mamba)的研究表明,训练好的模型会根据输入数据动态重新分配其状态空间,其中很大一部分迁移归因于输入相关机制,而不是通常与选择性相关的时步。
-
新工具可精确测量Mamba模型中的状态使用情况
研究人员开发了一种精确的工具来测量Mamba等选择性状态空间模型中的状态使用情况。该工具可以精确量化训练模型如何利用其模式,并预测丢弃特定模式所引入的误差。该工具揭示,模型会根据输入上下文动态地重新分配其状态空间,模式迁移会跨越层和上下文发生。
-
NVIDIA Nemotron 3 Nano:用于高效 AI 代理的开放模型
NVIDIA 发布了 Nemotron 3 Nano,这是一个拥有 300 亿参数的开放模型,专为高效推理和长上下文应用而设计。该模型采用了混合专家混合(Mixture-of-Experts)架构,每个 token 只激活其参数的一小部分,从而降低了强大推理性能的运营成本。Nemotron 3 Nano 在推理、编码和代理工作流基准测试中表现出竞争力,使其适用于构建需要处理大型文档或复杂任务的 AI 代理、编码助手和 RAG 系统的开发者。
-
NVIDIA 发布高效 Nemotron 3 LLM 系列,采用混合架构
NVIDIA 发布了两款新的大型语言模型 Nemotron 3 Nano 和 Nemotron 3 Ultra,专注于效率和高级功能。Nemotron 3 Nano 是一款 30B 级模型,专为私有推理和代理工作流设计,采用混合 Mamba-Transformer Mixture-of-Experts 架构,并支持高达 100 万个 token 以实现长上下文应用。Nemotron 3 Ultra 是一款 550B 参数模型,采用类似…
-
Ternary Mamba通过知识蒸馏和QAT实现3.61倍压缩
研究人员开发了一种压缩状态空间模型(SSMs)如Mamba-2的新方法,显著减小了其在边缘部署时的内存占用。通过采用分组量化感知训练(QAT)并结合来自预训练FP16模型的知识蒸馏,他们将Mamba-2 1.3B压缩至744 MB,减少了3.61倍。该方法在比以往方法更小的token预算下实现了具有竞争力的零样本准确率,同时还识别出一种新颖的、仅存在于预训练SSM的QAT中的不稳定性,称为“零比率崩溃”。
-
新的 N-VSSM 模型在长篇叙事一致性方面超越 Claude Opus 4.5
研究人员开发了 NarrativeWorldBench,这是一个旨在评估大型语言模型 (LLM) 在长篇音频戏剧中保持叙事一致性能力的新基准。目前的尖端 LLM 在超过 200 集的叙事弧方面存在困难,情节节拍 F1 分数饱和在 0.8 左右。为解决此问题,他们引入了 N-VSSM,一个利用 Mamba-2 主干的叙事变分状态空间模型,该模型在各种周期中实现了至少 0.84 的情节节拍 F1 分数,并在与专业作者的合作研究中证明了比 …
-
Compiler-first duality enables portable O(1) Mamba-2 inference
研究人员开发了一种优化 Mamba-2 推理的新方法,重点关注编译器优先的状态空间对偶性。这种方法实现了具有 $O(1)$ 复杂度的便携式自回归缓存,无需自定义 CUDA 或 Triton 内核。最终的单源推理路径在 JAX 中实现,在 Google Cloud TPU 和 NVIDIA GPU 上展示了显著的加速,实现了高硬件利用率并匹配了参考困惑度分数。
-
xLSTM 在序列建模任务中优于 Mamba-2 和 DeltaNet
一篇新的研究论文比较了三种亚二次方架构——xLSTM、Mamba-2 和 Gated DeltaNet——在序列建模任务上的表现。研究发现,在代码模型预训练、蒸馏和时间序列基础模型方面,xLSTM 的表现优于其他模型。研究人员将 xLSTM 的卓越性能归因于其通过门控方案实现的灵活且稳定的记忆校正能力,从而能够进行稳健的状态跟踪和累积。
-
DF-SSM将Mamba-2压缩至1比特,提升速度并减小尺寸
研究人员开发了密度场状态空间模型(DF-SSM),这是一个将大型SSM压缩到1比特骨架的新颖框架,同时性能损失极小。将其应用于Mamba-2 1.3B后,该模型尺寸缩小了九倍以上,推理速度显著提升,同时性能接近1.58比特模型。蒸馏过程效率极高,仅需有限的数据和计算资源。除了压缩,该研究还分析了模型的内部知识组织,揭示了意图分类、知识检索和输出格式化的不同阶段,表明表征结构可以独立于强大的事实回忆而发展。
-
动态卷积提升LLM中Transformer的性能
研究人员引入了动态短卷积作为一种新的基元,以增强大型语言模型中使用的Transformer架构。这些动态卷积利用输入相关的滤波器,在保持传统卷积的局部性偏差的同时,提高了表达能力。实验表明,在各种参数规模下,与标准Transformer和静态卷积变体相比,性能持续提高,这表明在计算优势和推进基于Transformer的语言模型方面具有潜力。
-
Mamba-2 解释探测器遗漏了一半的状态汇聚
研究人员发现,理解 Mamba-2 内部工作机制的方法存在重大局限性。他们发现,旨在将表征签名与计算执行联系起来的标准探测技术,仅捕获了模型“状态汇聚”机制的一小部分。这些单桶探测器遗漏了一个具有相似表征模式的更大“检测层”,这凸显了模型中表征相似性与实际功能执行之间的差距。
-
新框架使用贝叶斯记忆统一序列模型
研究人员引入了一个“设计-模型”框架,用于基于记忆假设创建高效的循环序列映射。该框架使用贝叶斯滤波将证据写入记忆,并使用依赖于查询的读出进行预测。他们的“贝叶斯层”实例化跟踪存储关联中的不确定性,提高了记忆保持和检索的鲁棒性。
-
新的Oryx模型灵活地在Attention和Recurrent Mixers之间切换
研究人员推出了一种新颖的混合模型Oryx,该模型能够灵活地在给定序列中不同序列混合器(如二次Attention和线性循环)之间进行切换。这种方法允许通过Attention实现丰富的上下文利用,通过线性循环实现高效生成,同时跨模式共享超过90%的参数。通过Mamba-2和Gated DeltaNet变体(高达1.4B模型)进行的验证表明,Oryx在语言建模任务上取得了与单一混合器基线相当或更优的性能,并在检索任务上以显著更少的Atten…
-
PapersWithCode 增加多指标排行榜和外部论文支持
Hugging Face 为 PapersWithCode(一个跟踪人工智能最新进展的平台)推出了新功能。更新包括支持排行榜上的多个指标,例如自动语音识别和目标检测。该平台现在还支持 arXiv 以外的外部论文,自动为其添加相关标签和数据,并显示论文的演变过程,以展示后续或先前的研究。