PulseAugur
实时 19:31:18
实体 Mamba

Mamba

PulseAugur coverage of Mamba — every cluster mentioning Mamba across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
46
90 天内 212
发布 · 30天
0
90 天内 0
论文 · 30天
44
90 天内 198
层级分布 · 90 天
主题
关系
情绪 · 30 天

18 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_216115 ·

    新的联邦学习框架集成了水印和安全聚合

    研究人员开发了一种新颖的联邦学习框架,该框架集成了带密钥溯源水印和格基安全聚合。该方法旨在防御多层攻击,包括数据泄露和恶意梯度操纵,这些是联邦学习系统中的常见漏洞。提出的解决方案使用物理锚点元数据和HMAC-SHA-256变换来创建安全的水印负载,确保数据溯源。此外,基于格的零知识安全聚合协议为梯度计算提供了后量子安全。

  2. TOOL · CL_212057 ·

    MambaX-Net通过Mamba增强注意力提升前列腺MRI分割能力

    研究人员开发了MambaX-Net,一种新颖的半监督分割架构,专为纵向前列腺MRI分析设计。该网络通过利用先前时间点的分割结果,解决了前列腺癌进展监测中专家标注有限的挑战。MambaX-Net包含一个Mamba增强交叉注意力模块,用于捕捉时空依赖性,以及一个形状提取模块,用于精细的区域划分,其性能优于现有的U-Net和Transformer模型。

  3. TOOL · CL_210534 ·

    Transformer 和 Mamba 模型展现出相似的集体动力学

    一篇新发表在 arXiv 上的研究论文探讨了神经网络架构的集体动力学,特别是比较了 Transformer 和 Mamba 等状态空间模型。研究发现,尽管它们内部机制存在根本差异,但两种架构在其长记忆动力学中都表现出相似的“红外普适性”。这表明不同的序列架构可以收敛到相关的近边际慢模动力学,将先前的发现扩展到 Transformer 之外,并为认知场理论提供了独立的检验。

  4. TOOL · CL_208652 ·

    新的S3AM框架增强了多模态显著目标检测

    研究人员开发了S$^3$AM,一种用于多模态显著目标检测的新型单流框架。该方法将可靠性校准频率适配器与Segment Anything Model (SAM)骨干网络集成,以减少计算冗余。该框架采用频率专家混合和双门控校准机制,选择性地在Transformer阶段传播校准后的残差信息,而超网络引导的解码器则结合了语义掩码特征和基于Mamba的结构细节恢复。实验表明,S$^3$AM在可训练参数数量显著减少的情况下,实现了具有竞争力的性能。

  5. TOOL · CL_206668 ·

    KHiM-Mamba架构通过知识集成增强病理图像分析

    研究人员开发了KHiM-Mamba,这是一种旨在改进病理学全切片图像分析的新型架构。该新模型将病理学知识直接集成到Mamba选择性状态空间模型中,增强了其在复杂图像中关注诊断相关信息的能力。通过使用显式知识先验调制隐藏状态,并利用大型语言模型进行语义描述,KHiM-Mamba在多个基准测试中取得了最先进的性能。

  6. TOOL · CL_206366 ·

    Mamba--MoE代理模型增强逆变器瞬态预测

    研究人员开发了一种新颖的Mamba代理模型,集成了专家混合(MoE)路由系统。该统一模型旨在处理逆变器瞬态的闭环仿真和测量窗口预测。通过使用具有任务条件和专家路由的单一Mamba骨干网络,Mamba--MoE代理模型在利用更少参数的情况下,实现了与单独的专业模型相当的低误差性能。自适应一致层为两种预测任务提供了可靠的预测区间。

  7. TOOL · CL_206355 ·

    受量子启发的复杂状态可大幅减少LLM训练步数

    研究人员探索了一种训练序列模型的新方法,该方法利用受量子理论启发的复数值状态表示,而不是传统的实数值状态。这种“量子捷径”方法应用于Mamba和Transformer模型时,显著减少了达到目标验证损失所需的优化步数。具体而言,复数值模型以其对应实数值模型的约三分之一到二分之一的步数实现了这些结果,展示了加速大型语言模型训练的潜在途径。

  8. TOOL · CL_206237 ·

    PhyxMamba 框架从有限数据中重建混沌系统

    研究人员推出 PhyxMamba,一个旨在从有限观测数据中重建混沌动力学系统的新型框架。该方法将基于 Mamba 的状态空间模型与物理信息原理相结合,利用时延嵌入和生成式训练方案。PhyxMamba 在捕捉局部轨迹演化和全局物理约束方面表现出卓越的性能,在 Lorenz96 系统上的预测精度和拓扑保真度方面显著优于现有方法。

  9. TOOL · CL_206109 ·

    调查量化了注意力机制中的EEI权衡

    一篇新发表在arXiv上的调查论文,探讨了注意力机制中效率、表现力和可解释性(EEI)之间的权衡。注意力机制是过去十年机器学习进步的基础。该论文分析了二十一种不同的方法,使用EEI评分框架和蒙特卡洛分析来评估其排名的稳定性。它追溯了注意力机制的演变,从早期的序列到序列模型到现代的视觉架构和Mamba等状态空间替代方案,还探讨了归纳头和叠加等可解释性技术。

  10. TOOL · CL_205903 ·

    新的CMR-Mamba方法改进了工业故障检测

    研究人员开发了CMR-Mamba,一种用于工业系统无监督故障检测的新方法,它超越了传统关注单个传感器数据的技术。这项新技术利用Mamba状态空间编码器来监控传感器组之间的因果关系,识别可能逃避标准监控的耦合故障。在机电、液压和网络物理系统上的实验证明了CMR-Mamba的有效性,特别是在检测保持正常传感器统计数据的细微故障方面。

  11. TOOL · CL_204136 ·

    新型CSG-Mamba模型提高了内窥镜息肉分割的准确性

    研究人员开发了CSG-Mamba,一种新型卷积评分门控视觉状态空间网络,旨在改进内窥镜息肉分割。该模型基于VM-UNet架构构建,在其瓶颈处集成了一个卷积评分门控模块,以重新校准状态空间特征。在Kvasir-SEG和CVC-ColonDB数据集上的实验表明,CSG-Mamba在重叠率和召回率指标上优于基线模型,同时保持了具有竞争力的边界准确性。

  12. TOOL · CL_198170 ·

    RT-SEMamba:基于Mamba的新模型提供实时语音增强

    研究人员开发了RT-SEMamba,一种利用因果时频Mamba块的新型实时语音增强模型。与需要不断增长的键值缓存的Transformer模型不同,该架构通过传播固定大小的循环状态,为长格式推理提供了内存和带宽效率。采用渐进式知识蒸馏策略将一个8层教师模型压缩到一个1层学生模型,在保持竞争力的质量的同时实现了显著的加速。

  13. TOOL · CL_193917 ·

    状态空间模型:从S4到Mamba的综述

    本文全面回顾了结构化状态空间模型(SSMs),追溯了它们从最初的S4架构到Mamba和Mamba-2等更先进模型的演进。文章分析了输入依赖选择性、循环和卷积视图之间的相互作用、对角化和缓存机制等关键设计维度。该回顾强调了SSMs在长上下文场景下的效率和有效性,使其成为Transformer的有力竞争替代品,同时也承认了Transformer在需要精确检索的任务中的优势。

  14. TOOL · CL_193697 ·

    新型AraSSM模型提供高效的阿拉伯语处理能力

    研究人员推出AraSSM,这是一种专为阿拉伯语掩码语言建模设计的新型双向Mamba编码器。该模型旨在通过利用选择性状态空间模型(SSM)来实现更高效的序列建模,从而克服传统Transformer编码器的二次方扩展限制。AraSSM在阿拉伯语维基百科和CulturaX的组合语料库上进行了预训练,并在多个阿拉伯语NLU基准测试上进行了评估,在情感分类和命名实体识别等任务上表现出与现有基于Transformer的模型相当或更优的性能。

  15. COMMENTARY · CL_190013 ·

    KV 缓存成为 LLM 瓶颈,推动注意力变体创新

    KV 缓存是 LLM 自回归解码的关键组成部分,被确定为 2026 年前沿模型的主要瓶颈。其大小随上下文长度和批处理大小线性增长,使其成为比模型权重更主要的内存消耗者。缓解此瓶颈的技术包括减少 KV 头(MQA、GQA)、使用潜在表示压缩缓存(MLA)以及通过线性注意力或状态空间模型(SSMs)完全消除不断增长的缓存。2026 年的主流方法是混合模型,它将全注意力层与线性/SSM 层交织在一起,以平衡质量和内存效率。

  16. TOOL · CL_187210 ·

    新的点燃指数指标衡量语言模型中的全局工作空间动态

    研究人员引入了点燃指数(I),这是一个旨在量化语言模型中全局工作空间动态的新指标。该标量指标通过分析输入信号强度响应的每层准确性转换,来操作化全局工作空间理论(GWT)的预测。在各种Transformer模型和SSM中,点燃指数在区分真正的语言结构和虚假的探测能力方面表现出9.6倍的选择性。研究结果表明,前馈Transformer的点燃指数通常高于SSM,而像Huginn-3.5B这样的循环架构沿其迭代轴与沿其深度轴相比,表现出不同的点燃模式。

  17. RESEARCH · CL_194148 ·

    新框架增强掩码 Transformer 并使状态空间模型适应缺失数据

    研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…

  18. TOOL · CL_185538 ·

    TSM-Pose 框架通过拓扑和语义增强物体姿态估计

    研究人员推出 TSM-Pose,一个旨在改进类别级物体姿态估计的新框架。该方法利用拓扑提取器从点云中捕获全局结构表示,并利用基于 Mamba 的全局语义聚合器通过整合语义先验来增强关键点表达能力。该框架在 REAL275、CAMERA25 和 HouseCat6D 等基准数据集上展示了卓越的性能,优于现有的最先进方法。

  19. TOOL · CL_185319 ·

    分层记忆Mamba增强长序列建模能力

    研究人员推出了一种名为分层记忆Mamba(Hierarchical Memory Mamba, HMM)的新型架构,旨在增强Mamba等循环线性注意力模型在长序列建模方面的能力。HMM借鉴了人类认知机制,引入了分层记忆系统,解决了固定容量循环状态中的表示瓶颈问题。该新模型集成了用于段落级语义的工作记忆和用于持久存储的长期记忆,实现了跨任务泛化。评估结果表明,HMM在Passkey Retrieval和LongBench-E等任务上显著…

  20. TOOL · CL_183462 ·

    基于Mamba的知识蒸馏增强LiDAR 3D目标检测

    研究人员开发了一个新的知识蒸馏框架,以提高使用LiDAR传感器的3D目标检测的效率。该方法将强大的教师模型的对象级体素表示转移到更轻量级的学生模型。通过利用Mamba(一种线性时间序列模型),该框架对齐了教师和学生网络之间的空间特征,显著降低了计算负荷,同时为自动驾驶等应用保持了具有竞争力的准确性。