Mamba
PulseAugur coverage of Mamba — every cluster mentioning Mamba across labs, papers, and developer communities, ranked by signal.
19 天有情绪数据
-
Mamba模型在法律AI基准测试中表现出竞争力
一篇新论文对Mamba及其变体SSD-Mamba在法律文本分类和案例检索方面与BERT、DeBERTa和Longformer等成熟的Transformer模型的性能进行了基准测试。该研究涵盖了欧洲人权法院和美国最高法院等多个法律语料库,发现虽然Transformer在某些指标上仍占优势,但SSD-Mamba的表现相当,并且处理文本的速度明显更快。这些初步发现表明,Mamba类模型是处理超出传统编码器模型上下文限制的日益增长的法律文件量…
-
HAN-Mamba模型利用Mamba架构增强金融波动率预测
研究人员开发了HAN-Mamba,这是一种新颖的混合架构,它将选择性状态空间模型(Mamba)与分层结构相结合,以改进金融波动率预测。该模型用Mamba编码器取代了其前身HAN-T中计算量大的Transformer编码器,从而显著减少了参数数量,并在Optiver已实现波动率预测基准测试中提高了性能。HAN-Mamba通过扩展其高频上下文处理能力并实现恒定时间流更新,展示了更高的准确性,优于其基于注意力机制的对应模型。
-
新的Mamba框架整合语言模型以增强CO2重建
研究人员开发了GeoPrior-Mamba,一个新颖的框架,将语言模型的结构化过程先验整合到一个基于Mamba的架构中,用于重建高分辨率的CO2(XCO2)场。该方法利用语言模型组织关于生物圈吸收、生态系统呼吸和人为排放的先验知识,然后将其自适应地注入重建模型。使用Orbiting Carbon Observatory 2数据进行测试,GeoPrior-Mamba相比现有方法实现了显著更低的RMSE和更高的R2,并且在Total Ca…
-
新的RSJEV框架使用MLLMs进行高效遥感场景分类
研究人员推出了一种新颖的遥感场景分类框架RSJEV,该框架利用了多模态大语言模型(MLLMs)。与生成文本的传统MLLMs不同,RSJEV将分类重新构建为判别式决策过程,直接估计类别概率而无需自回归解码。该方法在UC Merced和AID等基准测试中进行了测试,与现有的基于CNN、Transformer、Mamba和CLIP的方法相比,性能有所提高,并且由于模型更小,推理成本也有所降低。
-
RNN、Transformer 和 SSM:AI 内存的真正归宿
本次讨论探讨了循环神经网络(RNN)、Transformer 和状态空间模型(SSM)在内存管理方面的根本区别。RNN 使用紧凑的循环隐藏状态,这可能成为瓶颈。相比之下,Transformer 将过去的表示形式存储为键值对,创建了一个大型但动态的上下文缓存,与固定权重分开。SSM(如 Mamba)提供了一个折衷方案,具有依赖输入的状体压缩,这引发了关于内存压缩是固有局限性,还是架构可以更好地将内存与内部网络结构集成(如 BDH (Dr…
-
TII推出Falcon-Emirati-7B大语言模型以支持阿联酋方言
技术创新研究所(TII)开发了Falcon-Emirati-7B,这是一个专门的大型语言模型,旨在理解和生成阿联酋阿拉伯语。该模型建立在Falcon-H1-Arabic的基础上,采用了状态空间模型和Transformer注意力机制的混合架构,以实现高效精确的语言处理。Falcon-Emirati-7B旨在捕捉阿联酋口语方言中固有的细微差别、文化背景和非字面含义,而这些内容通常在通用阿拉伯语模型中会丢失。
-
新的机器学习遗忘方法解决了时间序列预测中的偏差和数据删除问题
两篇新研究论文介绍了针对时间序列预测的新型机器学习遗忘技术。第一篇论文 SSU-LSF 通过开发一个框架来消除非平稳混杂事件的影响,解决了 Mamba 等陆面预测模型中的偏差问题。第二篇论文 RDTU 提出了一个残差扩散框架来处理时间序列预测中的数据删除请求,解决了参数更新传播和已删除模式的非均匀支持等挑战。
-
新AI框架PI-AMFM增强生物医学信号分析
研究人员开发了PI-AMFM,一个新颖的神经网络框架,用于将生物医学信号分解为其组成的调幅-调频(AM-FM)模式。该方法解决了变分量基数数的挑战,意味着它可以在不需要预定义计数的情况下识别信号中不断变化的振荡模式数量。通过在训练过程中采用Mamba骨干网络和置换不变匈牙利匹配,PI-AMFM在合成数据上的分解、频率估计和模式计数方面表现出比现有技术更高的准确性。该框架还显示出捕捉实际光电容积描记记录中相关生理动力学(如心率和呼吸信号…
-
新研究揭示混合Transformer-SSM模型中的学习率迁移
一篇新研究论文探讨了混合架构的学习率(LR)缩放问题,该架构结合了Transformer和状态空间模型(SSM)模块,这些模块越来越多地用于生产语言模型中。研究发现,这些混合模型的实际实现,即使使用了简化的SSM,在各种宽度和深度下(高达十亿参数规模)也表现出接近零的学习率迁移差距。这种不变性归因于$\mu$P的初始化和学习率缩放,以及AdamW的逐参数归一化,它们共同维持了全局更新到权重的 Invariance 和局部组件的平衡。
-
深度学习模型WIPSNet改进了儿童喘息检测
研究人员开发了WIPSNet,一种利用隔夜阻抗图谱检测儿童喘息的新型深度学习模型。该3D ResNet架构处理连续小波变换标度图,达到了0.783的AUC,显著优于现有的呼气变异性指数(EVI)和Mamba模型等方法。该模型在32分钟时间上下文下的峰值性能,凸显了多尺度时间聚合对于分析长生理时间序列的重要性。
-
新的NC-SSM模型克服了Mamba、S4D和LRU的局限性
研究人员引入了非交换状态空间模型(NC-SSM),以解决现有选择性状态空间模型(如Mamba)的局限性。这些新模型,包括SO(3)-SSM和Cayley-SSM,将状态转换扩展到紧李群,实现了精确的保持范数的等距。基准测试表明,NC-SSM在跟踪A_5和S_5等复杂群方面显著优于对角线模型,并以最小的漂移保持黎曼流形。
-
新的指数加权签名模型扩展了状态空间模型
研究人员引入了指数加权签名(EWS),这是一种新颖的连续时间模型,通过计算路径的迭代积分并由可学习的生成器加权增量来扩展状态空间模型(SSM)。该模型保持了签名的群结构和通用性,同时实现了并行扫描。最基本地,EWS充当SSM,研究人员已证明其等同于线性时不变SSM、Mamba通道和Mamba-2头。在经验上,EWS在时间序列分类任务上表现出优越的性能,深度通常能提高准确性,并且在回归和预测任务上,以更少的参数达到了或超过了竞争SSM的性能。
-
HyDRA 网络融合 CNN、Transformer 和 Mamba 以实现高级 RFFI
研究人员开发了 HyDRA,这是一种新颖的混合双模网络,专为射频指纹识别 (RFFI) 设计。该架构集成了优化的变分模态分解 (VMD) 与卷积神经网络 (CNN)、Transformer 和 Mamba 组件的组合。HyDRA 能够支持闭集和开集分类任务,在闭集场景中展现出最先进的准确性,并在识别未经授权的设备方面表现出强大的性能。该系统已部署在 NVIDIA Jetson Xavier NX 上,实现了毫秒级推理速度和低功耗,使其…
-
深度学习框架提升巴西大豆产量预测能力
研究人员开发了一种新的深度学习框架用于预测作物产量,该框架已在巴西大豆产量上进行了测试。该框架仅使用常规天气数据和两个静态输入(作物年份和农业环境标签),使其具有输入节俭和可迁移性。包括 Transformer 和 Mamba 在内的各种深度学习模型与传统方法进行了基准测试,其中 Transformer 模型取得了最高的准确性。该研究还使用 SHAP 诊断分析了特征重要性,揭示了作物年份影响长期趋势,而天气和农业环境因素驱动年度变化。
-
新方法将混沌系统RNN训练速度提高了100倍以上
研究人员开发了一种新颖的方法,用于在混沌动力系统的长时序数据上训练循环神经网络(RNN)。他们的方法在NeurIPS 2026的重点论文中进行了详细介绍,该方法结合了DEER(一种用于RNN前向传播并行化的技术)和广义教师强制(GTF)。这种组合显著稳定了训练并减少了暴露偏差,与传统方法相比,速度提高了100倍以上。新技术允许在超过100万个时间步的时序数据上进行高效的并行时间训练,在动力系统重构任务中表现优于Mamba等模型。
-
新框架统一了六种范式下的55个高光谱图像模型
一份新的技术报告介绍了一个名为“高光谱图像模型”的框架,该框架旨在标准化和统一高光谱遥感深度学习模型的发展。该框架整合了六种主要范式下的55个模型,包括CNN、Vision Transformers和Mamba,以及来自各种传感器的24个基准数据集。该倡议旨在通过提供一个通用注册表、标准化的数据适应和稳健的评估方法来防止准确性指标虚高,从而解决该领域的碎片化和不一致问题。
-
新研究详细介绍了循环 Transformer 中的量化失败
研究人员在循环 Transformer 的训练后量化 (PTQ) 中识别出两种关键的失败模式,这些 Transformer 在递归步骤中重用权重。第一种称为“反馈暴露”,当量化层在没有恒等路径的情况下扰乱递归状态时发生,导致错误放大。第二种“校准盲目性”源于量化方法,这些方法基于初始激活值进行计算,而忽略了递归中的后续状态。在 Huginn-3.5B 和 Mamba 等模型上的实验证明了这些问题,而跨递归步骤累积 Hessian 的解…
-
ADPTNet:新型神经网络旨在匹配Transformer的效率
研究人员推出了一种新颖的神经网络架构ADPTNet,旨在克服Transformer在序列建模中的能耗问题。ADPTNet通过数据自适应、捕捉长距离依赖关系以及GPU并行化来匹配Transformer的性能,同时还融入了用于复杂推理的非线性递归。该架构结合了线性注意力和黎曼优化,以实现可预测的长期行为,并为时间尺度控制提供了理论保证。ADPTNet在选择性复制任务和序列CIFAR-10上已展示出改进的性能,在准确性和参数效率方面优于现有模型。
-
新研究解决KV缓存压缩问题,以实现高效LLM推理 · 跟踪10个来源
arXiv上发布的多篇研究论文提出了优化大型语言模型(LLM)中键值(KV)缓存的新方法,以提高推理效率并减少内存使用。EchoPress和PatchKV等技术旨在在不显著损失准确性的情况下修剪或补偿KV缓存压缩,而ResidualKV和KV-Kaizen等其他技术则探索自适应压缩策略。此外,ATTUNER和HeadGuard等方法分别侧重于查询端适应和选择性头部保护,以应用于LLM代理和视觉语言模型等特定场景。
-
CacheBack 通过条件化 KV 缓存传输改进多智能体通信
研究人员开发了 CacheBack,一种用于多智能体系统中接收器条件化潜在通信的新颖方法。该方法解决了在智能体之间传输完整 KV 缓存相关的内存和上下文成本问题。CacheBack 根据接收器智能体的需求过滤和压缩发送器智能体的 KV 缓存,显著提高了准确性并降低了延迟。该方法在包括 Transformer 和 Mamba 混合模型在内的各种模型架构中都显示出可比的改进。