Mamba-2
PulseAugur coverage of Mamba-2 — every cluster mentioning Mamba-2 across labs, papers, and developer communities, ranked by signal.
- uses LatentMoE 90%
- used by LatentMoE 90%
- instance of Recurrent Neural Networks 90%
- instance of State Space Models 90%
- instance of Mamba-1 90%
- competes with Gated DeltaNet 70%
- affiliated with State Space Models 70%
- used by Gated DeltaNet 70%
- competes with Mamba-3 70%
- competes with Recurrent Neural Networks 70%
- affiliated with LatentMoE 50%
- other Mamba-3 50%
6 天有情绪数据
-
SketchSSM 方法将 LLM 状态读取效率提升 10 倍
研究人员推出了一种新颖的方法 SketchSSM,通过近似状态读取来提高混合注意力模型的效率。该技术通过缓冲键值来减少 KV 缓存的增长并实现更大的解码批次,同时仍能保持准确性。SketchSSM 在 NVIDIA B300 和 Nemotron 3 Super 等硬件上实现了显著的加速和更高的解码吞吐量,优于标准的 vLLM 基线。
-
新的指数加权签名模型扩展了状态空间模型
研究人员引入了指数加权签名(EWS),这是一种新颖的连续时间模型,通过计算路径的迭代积分并由可学习的生成器加权增量来扩展状态空间模型(SSM)。该模型保持了签名的群结构和通用性,同时实现了并行扫描。最基本地,EWS充当SSM,研究人员已证明其等同于线性时不变SSM、Mamba通道和Mamba-2头。在经验上,EWS在时间序列分类任务上表现出优越的性能,深度通常能提高准确性,并且在回归和预测任务上,以更少的参数达到了或超过了竞争SSM的性能。
-
新的 REALM 框架实现了脑机接口的因果 LFP 解码
研究人员开发了 REALM,一个用于因果局部场电位 (LFP) 行为解码的新框架。这种回顾性知识蒸馏方法将表征知识从一个非因果的“教师”模型转移到一个因果的“学生”模型。REALM 仅使用 LFP 就展示了具有竞争力的解码精度,其性能优于参数更少、预训练时间显著更短的非因果多模态模型。
-
新的注意力机制提升长上下文序列建模能力
两篇新论文介绍了增强循环神经网络长上下文序列建模能力的新方法。第一篇论文“SMat-Attention”提出了结构化矩阵注意力(Structured Matrix Attention),该方法使用结构化因果掩码来实现具有可调复杂度的灵活标记交互,实现了亚二次填充和恒定时间解码。第二篇论文“Triadic Linear Attention”通过使用三元外积创建3D张量状态来泛化线性注意力,显著提高了长上下文语言建模和回忆准确性。
-
选择性状态空间模型显示出与 Transformer 相似的 Token 共识
研究人员探索了选择性状态空间模型 (SSM) 的动态,并将其 Token 聚合机制与 Transformer 中的机制进行了比较。通过从动力学系统的角度分析 SSM,他们发现 SSM 内部的递归驱动 Token 达成共识,这与 Transformer 中注意力机制的功能相似。这种共识的特点是局部指数稳定性,尽管对 Mamba-2 的数值实验表明输出门调节了收敛的程度。
-
新研究分解 Mamba 的联想回忆,识别训练干预措施
一篇新发表在 arXiv 上的研究论文探讨了固定状态递归神经网络的联想回忆能力,特别是比较了 Mamba 和 Mamba-2 架构。该研究沿着因果卷积、转换结构和衰减的轴分解回忆性能,发现因果卷积对性能有显著影响。该研究还引入了一种课程学习方法,通过解决干扰来显著提高回忆准确性,这表明训练方法是克服局限性的关键因素。
-
新研究提出通过检查点重放实现大型语言模型的精确记录遗漏
一篇新研究论文介绍了一种在大型语言模型(LLMs)中实现精确记录遗漏的方法,这是隐私和数据管理的关键方面。该研究提出了一种“传输标准”和“重放证书”,以确保在删除记录时,模型的状态能够准确地反映记录从未存在过的情景。在Kimi Linear、Mamba-2、Falcon-H1和RWKV-7等模型上的实验表明,现有方法效果不佳,会留下残留痕迹。该论文提出,检查点重放(即从记录插入之前的模型状态恢复,然后重放后续对话)是实现精确遗漏的最有效方法。
-
AI 的下一个前沿:Mamba、JEPA 和 Diffusion 模型有望取代 Transformer
自 2017 年以来占据主导地位的 Transformer 架构正经历着 AI 领域的周期性转变,可能被状态空间模型(Mamba)和联合嵌入预测架构(JEPA)等新架构取代。这种转变是由 Transformer 的局限性驱动的,例如长上下文的二次方扩展问题、训练数据收益递减、高昂的能源成本以及超越模式匹配实现真正理解的基本能力不足。Gemini Diffusion、Nvidia 的 Nemotron 3 和 Qwen 3.5 等新兴模…
-
新的“隐藏状态投毒攻击”针对基于 Mamba 的 AI 模型
研究人员发现了一种新型攻击,称为隐藏状态投毒攻击(HiSPA),该攻击专门针对 Mamba 等状态空间模型(SSM)。这些攻击通过覆盖模型的隐藏状态来诱导模型部分失忆,从而降低其在信息检索任务上的性能。实验表明,即使是 Jamba-1.7-Mini 等先进的混合模型,在 RoBench-25 和 Open-Prompt-Injections 等基准测试上的表现也比纯 Transformer 模型差。研究还分析了 Mamba-2 和基于…
-
SSDi8框架通过8位量化增强Mamba-2架构
研究人员开发了SSDi8,一种专门针对Mamba-2架构的结构化状态空间对偶(SSD)的新型8位量化框架。该方法旨在减少Mamba-2集成循环和注意力模式所带来的内存和延迟开销。SSDi8通过重新构建计算以重用量化激活并自适应地量化通道变化的激活来实现这一点。实验表明,在W4A8和W8A8设置下,SSDi8在保持与FP16相当的准确性的同时,速度提升高达1.4倍,并且已成功部署在Orin NX等资源受限的设备上。
-
NVIDIA发布具有100万上下文的Nemotron-Labs-Teacher模型 · 跟踪4个来源
NVIDIA发布了一系列Nemotron-Labs-Teacher模型,每个模型拥有5500亿参数,但只有550亿参数被激活使用。这些模型采用了包含Mamba-2、MoE和多Token预测的LatentMoE架构,支持高达100万Token的上下文窗口。这些模型在OpenMDW-1.1许可下可用,并且需要大量的硬件支持,例如4块B200/GB200或8块H100 GPU才能运行。
-
英伟达的 NeMo Switchyard 将 AI 代理成本降低 74%,盖过了其新模型发布
英伟达发布了两项新技术:Nemotron 3.5 Lightning,一个开源权重语言模型;以及 NeMo Switchyard,一个用于 AI 代理的开源路由库。虽然 Nemotron 3.5 Lightning 是一个标准的 30B 参数模型,但 NeMo Switchyard 因其显著降低 AI 代理成本的潜力而备受关注。早期基准测试表明,NeMo Switchyard 可通过智能路由请求至更便宜的模型,将大部分调用避开昂贵的尖…
-
状态空间模型:从S4到Mamba的综述
本文全面回顾了结构化状态空间模型(SSMs),追溯了它们从最初的S4架构到Mamba和Mamba-2等更先进模型的演进。文章分析了输入依赖选择性、循环和卷积视图之间的相互作用、对角化和缓存机制等关键设计维度。该回顾强调了SSMs在长上下文场景下的效率和有效性,使其成为Transformer的有力竞争替代品,同时也承认了Transformer在需要精确检索的任务中的优势。
-
新的 nGPT 训练方法将 MoE 模型所需的 token 数量减半
研究人员开发了一种名为归一化 Transformer (nGPT) 的新训练方法,该方法将模型参数和激活限制在单位超球面上,以改进表示学习。这一方法在最近的 arXiv 论文中进行了详细介绍,包括 Logit Gradient Preconditioning、Logarithmic Learning Rate Decay 和 GatedAdamW 等技术。当应用于混合 Mamba-2--Transformer Mixture-of-E…
-
DART架构通过融合Transformer和SSM来增强长上下文序列建模
研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。
-
JAXBench 推出以优化 Google TPU 上的 AI 内核
一个名为 JAXBench 的新基准测试套件已被开发出来,专门用于解决 Google Cloud TPU 上 AI 内核性能的优化问题。该套件包含 50 个 JAX 工作负载,这些工作负载源自 Llama-3.1、DeepSeek-V3 和 Gemini 3 Flash 等知名 AI 模型。初步评估表明,提供精选的 TPU 文档可显著提高 AI 生成内核的正确性,将其从 5.8% 提高到 37.3%,并实现了比 XLA 快 1.6 倍的速度。
-
新仪器精确测量 Mamba 模型状态使用情况和输入驱动迁移
研究人员开发了一种新仪器,可以精确测量选择性状态空间模型(如 Mamba)如何利用其内部模式。该工具能够精确量化模式对模型输出的贡献,从而能够预测因丢弃特定模式而产生的错误。对 Mamba 系列(包括 Mamba-1、Mamba-2 和 Falcon-Mamba)的研究表明,训练好的模型会根据输入数据动态重新分配其状态空间,其中很大一部分迁移归因于输入相关机制,而不是通常与选择性相关的时步。
-
新工具可精确测量Mamba模型中的状态使用情况
研究人员开发了一种精确的工具来测量Mamba等选择性状态空间模型中的状态使用情况。该工具可以精确量化训练模型如何利用其模式,并预测丢弃特定模式所引入的误差。该工具揭示,模型会根据输入上下文动态地重新分配其状态空间,模式迁移会跨越层和上下文发生。
-
NVIDIA Nemotron 3 Nano:用于高效 AI 代理的开放模型
NVIDIA 发布了 Nemotron 3 Nano,这是一个拥有 300 亿参数的开放模型,专为高效推理和长上下文应用而设计。该模型采用了混合专家混合(Mixture-of-Experts)架构,每个 token 只激活其参数的一小部分,从而降低了强大推理性能的运营成本。Nemotron 3 Nano 在推理、编码和代理工作流基准测试中表现出竞争力,使其适用于构建需要处理大型文档或复杂任务的 AI 代理、编码助手和 RAG 系统的开发者。
-
NVIDIA 发布高效 Nemotron 3 LLM 系列,采用混合架构
NVIDIA 发布了两款新的大型语言模型 Nemotron 3 Nano 和 Nemotron 3 Ultra,专注于效率和高级功能。Nemotron 3 Nano 是一款 30B 级模型,专为私有推理和代理工作流设计,采用混合 Mamba-Transformer Mixture-of-Experts 架构,并支持高达 100 万个 token 以实现长上下文应用。Nemotron 3 Ultra 是一款 550B 参数模型,采用类似…