PulseAugur
中
实时 09:35:28
实体 Mamba2

Mamba2

PulseAugur coverage of Mamba2 — every cluster mentioning Mamba2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
14
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_284580 ·

    RAM-Net 引入稀疏状态访问以改进序列建模

    研究人员推出 RAM-Net,这是一种新颖的序列建模方法,旨在减轻循环状态中的跨令牌干扰。与使用共享密集状态的传统方法不同,RAM-Net 采用组织成独立槽的稀疏可寻址状态。这使得具有不同地址的令牌可以被定向到单独的槽,从而抑制干扰并改善细粒度的远程回忆。RAM-Net 在检索任务上表现出卓越的性能,并实现了具有竞争力的常识推理,同时与 Mamba2 等基线相比,每步访问的状态元素更少。

  2. TOOL · CL_280172 ·

    新分析探讨了 Mamba2 状态空间模型的联邦学习

    研究人员开发了应用于选择性状态空间模型(SSM),如 Mamba2 的联邦学习算法的新收敛性分析。现有的联邦学习方法在很大程度上是与架构无关的,并且没有考虑到现代 SSM 的独特特性。该研究推导了 SSM 的面向架构的界限,并在此背景下分析了 FedAvg 和 FedProx 的性能。在 Mamba2 语言建模的各种文本域上进行了实验,以验证这些界限并解释 SSM 联邦学习算法的行为。

  3. TOOL · CL_268970 ·

    单变量深度学习模型在波高预报中收益递减

    一篇新的arXiv论文探讨了单变量深度学习模型在预报显著波高(Hs)方面的局限性。研究发现,尽管DLinear、LSTM、PatchTST、ResAttLstm和Mamba2等模型可以优于持久性预报,但在大型数据集上,架构差异带来的收益很小。研究表明,当前的单变量模型已达到收益递减的程度,而跨浮标方差比模型架构对预报误差的影响更大。未来的工作应侧重于纳入大气协变量并将Hs分解为涌浪和风浪成分。

  4. TOOL · CL_268828 ·

    新AI模型AMOR根据预测不确定性选择性使用注意力

    研究人员推出了一种新颖的混合AI架构AMOR(自适应元认知输出路由器),该架构根据预测不确定性选择性地采用注意力机制。这种方法用熵门控注意力块增强了循环骨干网络,这些块仅在模型输出熵超过动态阈值时激活。在FineWeb-Edu数据集上进行测试,采用Mamba2或Gated DeltaNet骨干网络的AMOR变体,在常识推理得分上优于现有的循环、仅注意力以及固定调度的混合模型。该架构还展示了改进的检索性能,并保持了其循环组件的长上下文鲁…

  5. RESEARCH · CL_218032 ·

    新的审计方法可检测到注意力掩码所遗漏的因果关系泄露

    研究人员开发了一种新的审计方法,用于检测序列模型中的因果关系违反,该方法超越了传统的注意力掩码检查。这种轻量级的审计只需两次前向传播而无需训练,即可精确地定位表示依赖于未来输入的层。研究发现,虽然注意力掩码检查遗漏了所有因果关系泄露,但他们的审计成功地识别了Zamba2和Nemotron-H等模型中的缺陷,同时确认了Bamba-9B、Falcon-H1、Granite-4.0-H、Mamba2和RecurrentGemma等其他模型是干净的。

  6. FRONTIER RELEASE · CL_194610 ·

    NVIDIA 发布 Nemotron 3.5 Lightning 草稿模型以实现专业化解码 · 跟踪 3 个来源

    NVIDIA 发布了 Nemotron 3.5 Lightning 30B-A3B 系列下的新型草稿模型,专为专业化解码任务设计。Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 拥有 8.33 亿参数,可在 H100 和 RTX 5090 等硬件上加速 30B 目标模型以进行 DFlash 解码。另一个变体 Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark …

  7. TOOL · CL_167900 ·

    新的RAD框架通过全局记忆和局部注意力增强长视频生成

    研究人员引入了一个名为循环自回归扩散(RAD)的新框架,旨在改进长视频生成。RAD将时间循环神经网络(RNN)层(特别是LSTM)集成到扩散Transformer模型中,以增强长视频序列的记忆压缩和检索。这种方法解决了先前模型使用滑动窗口注意力所存在的局限性,这些模型由于遗忘和时空不一致性而在长期一致性方面遇到困难。在Memory Maze和Minecraft数据集上的实验表明,RAD在生成具有全局记忆和局部注意力的长视频方面是有效的。

  8. FRONTIER RELEASE · CL_130046 ·

    NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B 以支持 Blackwell 硬件

    NVIDIA 发布了其 Nemotron-Labs-3-Puzzle-75B 模型,该模型已针对 Blackwell 硬件上的服务进行了优化。该模型集成了 LatentMoE、Mamba-Interleaving 和 Multi-Token Prediction (MTP) 以提高吞吐量。它在 OpenMDW-1.1 许可下可用,允许商业使用。

  9. RESEARCH · CL_86018 ·

    Zyphra 发布 Zamba2-VL 混合视觉语言模型

    Zyphra 推出了 Zamba2-VL,一个新推出的开源视觉语言模型家族。这些模型采用了结合 Mamba2 状态空间模型和 Transformer 的混合架构,与传统的 Transformer 模型相比,处理速度显著提高。Zamba2-VL 提供 1.2B、2.7B 和 7B 参数规模的版本,基准测试表明其在提高速度的同时也具有高准确性。

  10. TOOL · CL_65479 ·

    Zamba2-VL 模型提供更快的视觉-语言处理速度

    研究人员推出了一系列新的视觉-语言模型 Zamba2-VL,该模型利用了结合 Mamba2 状态空间层和 Transformer 块的混合架构。这些模型在各种视觉和语言任务上表现出色,可与 Molmo2 和 Qwen3-VL 等成熟的基于 Transformer 的模型相媲美。Zamba2-VL 的一个关键优势是其显著更快的首个 token 生成时间,这使其特别适合设备端和边缘部署。

  11. TOOL · CL_51634 ·

    MambaBEV模型使用Mamba2改进3D目标检测

    研究人员推出MambaBEV,一款利用Mamba2状态空间模型的新型自动驾驶3D目标检测模型。该方法增强了鸟瞰图(BEV)空间内的全局上下文建模,解决了先前基于卷积或注意力的方法的局限性。在nuScenes数据集上的评估显示,MambaBEV达到了51.7%的NDS和42.7%的mAP,证明了其在大目标检测方面的有效性以及在端到端自动驾驶系统中的潜力。

  12. TOOL · CL_51205 ·

    SurgicalMamba模型提高了手术阶段识别的准确性

    研究人员开发了SurgicalMamba,这是一种用于在线手术阶段识别的新型模型。该模型利用受Mamba2启发的双路径状态空间对偶(SSD)架构,以高效处理冗长的手术视频。关键创新包括用于自适应状态更新的强度调制步进和用于跨通道混合的状态重塑,这些共同提高了准确性和速度。

  13. TOOL · CL_32547 ·

    SurgicalMamba模型推进在线手术阶段识别

    研究人员开发了SurgicalMamba,这是一种用于在线手术阶段识别的新型模型。该模型通过采用双路径结构化状态空间对偶(SSD)方法,解决了手术视频分析中的挑战,例如手术时长长和时间流不均匀。SurgicalMamba在多个基准测试中达到了最先进的准确度,在严格的在线评估条件下优于先前的方法。

  14. FRONTIER RELEASE · CL_07750 ·

    NVIDIA 发布 Nemotron 3 Nano Omni 多模态 AI 模型,用于智能体

    NVIDIA 发布了 Nemotron 3 Nano Omni,这是一款能够同时处理视觉、音频、视频和文本的多模态大型语言模型。该开放模型基于 Mamba2 Transformer 混合专家模型架构构建,旨在通过实现单一多模态理解推理循环来增强企业智能体工作流程。它现已在 Fireworks 和 Amazon SageMaker JumpStart 上提供,提供 131K 的上下文长度,并获得商业使用许可。