State Space Models
PulseAugur coverage of State Space Models — every cluster mentioning State Space Models across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
新的MaRK框架动态条件化状态空间模型
研究人员推出了一种新颖的框架MaRK(Markov-adapted Recurrent Kernels),用于在迭代生成任务中动态条件化状态空间模型(SSMs)。与先前调节输入或激活的方法不同,MaRK直接修改SSM的核心参数,包括循环、读入、读出和离散化。这种方法允许每个扩散时间步重塑模型的记忆核,提供了一种更集成的条件化形式。该框架使用三种适配器几何结构(Hypernet、Chebyshev多项式和离散余弦变换核)在1.11亿参数…
-
新的指数加权签名模型扩展了状态空间模型
研究人员引入了指数加权签名(EWS),这是一种新颖的连续时间模型,通过计算路径的迭代积分并由可学习的生成器加权增量来扩展状态空间模型(SSM)。该模型保持了签名的群结构和通用性,同时实现了并行扫描。最基本地,EWS充当SSM,研究人员已证明其等同于线性时不变SSM、Mamba通道和Mamba-2头。在经验上,EWS在时间序列分类任务上表现出优越的性能,深度通常能提高准确性,并且在回归和预测任务上,以更少的参数达到了或超过了竞争SSM的性能。
-
新理论将状态空间模型训练视为最优控制
研究人员开发了一个新的理论框架来理解状态空间模型(SSMs)的训练动态。通过将连续时间SSM参数优化构建为集成最优控制问题,他们通过状态轨迹和共享控制参数来分析训练过程。这种方法揭示了哈密顿梯度代表目标的一阶变分密度,从而产生了一个Bregman镜像下降方案,在欧几里得几何中简化为函数投影梯度下降。稳定性分析表明,在充分正则化下,最优控制问题存在唯一的最小值,并确定了SSMs的具体收敛速率。
-
新研究通过深度递归和输入重塑改进状态空间模型
一篇新的研究论文介绍了两种增强状态空间模型(SSM)的方法,使其更高效、性能更好。第一种方法是深度递归,通过多次迭代一个较小的模型来减少SSM的内存占用,同时不牺牲性能。第二种方法通过调整时间粒度和特征维度来优化呈现给模型的信息,从而提高性能。这些技术在LRU、S5、LinOSS和LrcSSM等几种SSM架构上进行了测试,并显示出持续的益处。
-
新的LipSSM架构通过级联状态空间模型增强DNN的鲁棒性
研究人员推出了一种新颖的级联状态空间模型(SSM)架构LipSSM,旨在增强深度神经网络(DNN)的鲁棒性。该新模型基于LipKernel概念,该概念在连续层之间传递信息,以实现比传统逐层方法更严格的Lipschitz界限。通过将此应用于级联SSM,LipSSM旨在在保持可验证鲁棒性的同时,改进长期依赖关系的建模。
-
新的融合方法合并了不同的视觉模型
研究人员开发了一种名为黎曼-洛伦兹参数融合(RLPF)的新颖方法,用于合并独立训练的视觉模型,即使它们的架构不同。该技术通过对齐参数组并将它们投影到通用坐标系来解决合并Vision Transformers(ViTs)和状态空间模型(SSMs)等模型的挑战。RLPF方法然后利用一个学习到的门来组合这些混合分支的输出,在CIFAR-10、Oxford-IIIT Pet和ImageNet-1K等基准数据集上展示了改进的性能。
-
状态空间模型提高长上下文语言模型效率
研究人员开发了一种新的语言模型演示选择方法,旨在降低长上下文场景相关的计算成本。该方法利用状态空间模型(SSMs)来蒸馏Transformer模型,实现了低于0.7%的蒸馏误差。实验表明,与现有的选择方法相比,该方法可以将FLOPs降低14.2倍,并在各种文本分类和推理任务上提高6.48%的准确率。
-
研究发现:门控机制阻碍状态空间模型的上下文学习
一篇新发表在arXiv上的研究论文探讨了状态空间模型(SSMs)中门控机制的作用,SSMs正作为Transformer在序列建模方面的替代方案而兴起。研究表明,这些门控机制可能导致SSMs优先考虑记忆而非上下文学习,从而可能阻碍它们在需要精确检索的任务上的表现。虽然门控可以提高长序列的泛化能力,但它对训练动态和有效上下文学习解决方案收敛的影响是线性时间模型改进的关键领域。
-
研究揭示了 Transformer 和 SSM 在层重要性方面的根本差异
一篇新发表在 arXiv 上的研究论文通过分析层重要性,探讨了 Transformer 和状态空间模型(SSM)之间的差异。该研究引入了两个指标:“必要性”(necessity),衡量层对其现有贡献的依赖程度;以及“可塑性”(plasticity),量化层在微调过程中吸收新信息的能力。研究结果表明,在 Transformer 中,必要性和可塑性在深度上呈负相关;而在 Mamba 类 SSM 中,它们则一致。这种差异也预示了下游适应行为…
-
视觉骨干网络在机器人树分割和深度估计方面的比较
一篇新的研究论文探讨了不同的视觉骨干网络架构对机器人应用的联合树分割和立体深度估计的影响。研究发现,卷积模型和混合模型在性能上优于Transformer模型,其中一个小型编码器显著优于许多大型模型。有趣的是,分割和深度估计任务的排名显示出高度一致性,一个关键发现是边界F1指标揭示了区域IoU指标所隐藏的分割失败。
-
新框架实现从Transformer到Mamba模型的知识高效迁移
研究人员开发了一个名为“跨架构注意力桥接蒸馏”(CAB)的新蒸馏框架,以有效地将知识从Transformer模型迁移到Mamba等状态空间模型(SSMs)。该方法通过对齐Transformer的注意力相关表示与Mamba的状态投影,实现token级别的中间监督,从而在不增加推理时间的情况下促进跨架构知识迁移。实验表明,CAB提高了蒸馏效果,尤其是在低数据场景下,弥合了成熟的Transformer生态系统与新兴的SSM生态系统之间的差距。
-
新的Mamba架构通过解耦特征增强图像分类
研究人员开发了空间-上下文微分Mamba (SCDM),一种用于图像分类的新型架构,旨在提高病理特征与正常解剖结构之间的区分度。SCDM采用非对称双分支设计,其中正分支用于疾病特异性特征,负分支用于抑制正常解剖上下文。该方法采用相似性驱动的排斥门和微分推理规则,在RSNA肺炎数据集上实现了0.858的AUC,且参数量和FLOPs少于现有模型。
-
新的DCRA框架增强了临床数据时间序列学习的鲁棒性
研究人员开发了一个名为扩散条件表示对齐(DCRA)的新训练框架,旨在提高时间序列学习的鲁棒性,特别是在脑电图(EEG)和心电图(ECG)分析等临床应用中。DCRA利用前向扩散过程创建结构化的腐蚀轨迹,从而在不同噪声水平下实现表示的可控演化。这种方法可以与状态空间模型(State Space Models)和Transformer等各种架构集成,并在嘈杂条件下在CHB-MIT EEG数据集上显示出改进的癫痫检测性能。
-
新框架利用路径签名和 T-Mamba 增强在线签名验证
研究人员开发了一种新的在线签名验证框架,该框架结合了增强路径签名 (APS) 描述符和 T-Mamba 模型。APS 描述符通过在进行时间和基点增强后计算滑动窗口路径签名来捕获几何结构和非线性交互。T-Mamba 模型是一种混合设计,结合了时间卷积网络块和时间扫描 Mamba,能够学习局部时间模式和全局长距离依赖关系。这种集成方法在基准数据集上展示了最先进的性能,尤其是在训练数据有限的情况下。
-
Kalman Delta Networks 通过不确定性感知记忆增强语言模型
研究人员推出了一种名为 Kalman Delta Networks (KDNs) 的新型模型系列,旨在通过引入不确定性感知来增强语言模型中的联想记忆。这些网络将循环联想记忆重新构建为线性高斯状态空间模型,利用卡尔曼滤波器最优地估计记忆状态及其不确定性。KDNs 允许更新根据累积证据和观测可靠性进行调整,改进了现有缺乏显式置信度跟踪的 Delta-rule 模型。开发了两种兼容扫描的近似方法:Diagonal KDN 和 Isotrop…
-
新型递归二次滤波器增强了深度循环网络的学习能力
研究人员开发了递归二次滤波器(RQF),一种新型复值时间滤波器,以改进深度连续时间循环网络中的学习。这些滤波器受生物机制启发,充当具有可调频率和带宽的带通滤波器。通过使每一层的输入前瞻性,该方法减轻了深度网络堆栈中的梯度衰减,尤其是在使用仅空间反向传播时。评估表明,RQF变体在各种模型和任务上匹配或超越了其非前瞻性对应物,包括在Speech Commands数据集上以参数高效的RQF实现了高精度。
-
新的“隐藏状态投毒攻击”针对基于 Mamba 的 AI 模型
研究人员发现了一种新型攻击,称为隐藏状态投毒攻击(HiSPA),该攻击专门针对 Mamba 等状态空间模型(SSM)。这些攻击通过覆盖模型的隐藏状态来诱导模型部分失忆,从而降低其在信息检索任务上的性能。实验表明,即使是 Jamba-1.7-Mini 等先进的混合模型,在 RoBench-25 和 Open-Prompt-Injections 等基准测试上的表现也比纯 Transformer 模型差。研究还分析了 Mamba-2 和基于…
-
ButterMamba框架通过噪声过滤和Mamba架构增强交通预测
研究人员推出ButterMamba,一个新颖的框架,旨在实现高效准确的交通流预测。该模型集成了Butterworth频谱滤波模块,用于去除传感器数据中的高频噪声,以及一个利用并行Mamba架构的空间-时间状态混合器,用于捕捉时空依赖性。ButterMamba实现了线性计算复杂度,在预测精度上优于现有最先进模型,同时减少了训练时间和内存使用。
-
CrossMambaTuning 使用状态空间模型增强机器视觉模型微调
研究人员开发了一个名为 CrossMambaTuning 的新框架,用于机器视觉模型的参数高效微调。该方法将状态空间模型与跨层交互机制相结合,包含一个高效的 Mamba 适配器和一个尺度不变跨层适配器 (SICA)。实验表明,CrossMambaTuning 在实现最先进性能的同时,与现有方法相比,参数开销减少了 72%。
-
BanglaMamba:状态空间模型为孟加拉语假新闻检测提供高效替代方案
研究人员探索了使用基于 Mamba 的状态空间模型 (SSM) 来检测孟加拉语假新闻,并提出了一个名为 BanglaMamba 的新模型。该方法旨在为基于 Transformer 的模型(如 BanglaBERT)提供一种计算效率更高的替代方案,后者因其二次复杂度而在处理长文档时遇到困难。虽然 BanglaBERT 在特定数据集上取得了最高性能,但 BanglaMamba 在推理速度和内存使用方面显著优于自定义 BERT 模型,并取得…