State Space Models
PulseAugur coverage of State Space Models — every cluster mentioning State Space Models across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
研究发现,对角线 SSM 在状态跟踪方面表达能力有限
一篇新的研究论文探讨了对角线状态空间模型(SSM)在应用于状态跟踪任务时的理论局限性。该研究表明,单层对角线 SSM 无法以有限精度跟踪非阿贝尔群。此外,研究确定 k 层对角线 SSM 只能跟踪具有特定次正规序列结构的群,从而有效地定义了它们在可解群内的表达能力。实证方面,论文指出多层模型在学习非阿贝尔群的状态跟踪时常常遇到困难,这表明理论表达能力与实际可学习性之间存在差异。
-
ChronoSSM 模型联合学习事件和时间戳
研究人员开发了 ChronoSSM,这是一种新颖的自回归状态空间模型,旨在联合学习事件和时间戳表示。这种方法与将时间视为次要问题或使用单独模型进行时间分析的传统方法形成对比。ChronoSSM 的联合训练机制在不影响内容生成质量的情况下,持续提高了模型表示中到达间隔信息的恢复能力。
-
MixFormer:新型线性Transformer增强长序列建模能力
研究人员推出MixFormer,这是一种新颖的线性Transformer,旨在提高超长序列建模的效率。该模型通过引入混合记忆专家(MoE)机制和时间感知线性注意力(TALA)技术,解决了现有状态空间模型(SSMs)的局限性。MixFormer利用多个协作的记忆专家来维护差异化的记忆状态,并使用可学习的衰减函数和位置偏差动态更新记忆,从而改进了文本和图像生成等任务的远程依赖建模。
-
新研究探索脉冲神经网络的高级训练方法
近期 arXiv 上的两篇论文探讨了训练脉冲神经网络(SNNs)的高级技术。第一篇论文介绍了一个通用框架,通过引入额外的状态变量来整合延迟到 SNNs 中,增强其捕捉时间依赖性的能力,并在较小网络中显示出效率提升。第二篇论文提出了 Phase State Space Models,它将状态空间模型(State Space Models)适配于 SNNs 的并行和无替代训练,在一个与脉冲兼容的架构中整合了短时傅里叶变换(STFT)、循环…
-
新框架增强掩码 Transformer 并使状态空间模型适应缺失数据
研究人员开发了 iFAN,一个旨在通过使查询排名与掩码质量保持一致并改进中间预测蒸馏来增强掩码 Transformer 的训练框架。该方法解决了最高概率查询不一定产生最准确掩码的匹配问题,以及早期层产生的优越预测会丢失的问题。在 COCO 和 Cityscapes 等数据集上的实验表明,iFAN 以最小的开销持续提高分割性能。另外,一篇论文介绍了 Partial Vision Mamba (PVM),用于使 Mamba 等状态空间模型…
-
新研究探索使用Transformer对动力学系统进行建模 · 跟踪2个来源
两篇新的arXiv论文探讨了Transformer模型在理解和预测动力学系统中的应用。第一篇论文分析了单层Transformer的机械特性,将因果自注意力解释为历史依赖的递归,并识别了线性和非线性系统的运行模式。第二篇论文介绍了一种用于ODEFormer(一个将ODE轨迹映射到方程的预训练Transformer)的验证器引导工作流程,以提高这些模型向高维物理数据的可靠迁移能力,并实现可解释、物理可审计的预测。
-
新的 Python 包简化了状态空间模型可微分粒子滤波器的实现
研究人员开发了 PyDPF,一个基于 PyTorch 的新 Python 包,实现了几种可微分粒子滤波器 (DPF)。该包旨在使状态空间模型的高级蒙特卡洛方法更容易被研究界使用。通过修改重采样步骤,这些 DPF 允许基于梯度的优化,解决了传统粒子滤波器的关键限制。
-
New metric uses eigenvalues to analyze memory dynamics in sequence models
研究人员引入了一种使用特征值来分析和比较不同序列建模架构(特别是softmax attention和State Space Models (SSMs))的记忆动态的新颖指标。这种方法借鉴了动力学系统理论,提供了一个统一的分析框架,揭示了与任务需求和长程依赖建模相关的谱特征。研究结果表明,特征值分析可以指导架构修改、训练过程,并提供对特征重要性的见解,最终旨在提高序列模型的能力。
-
DART架构通过融合Transformer和SSM来增强长上下文序列建模
研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。
-
新研究解决人工智能模型的灾难性遗忘问题 · 已追踪 7 个来源
研究人员正在开发新颖的方法来解决持续学习中的灾难性遗忘问题,即人工智能模型在学习新任务时会丢失先前获得的知识。最近几篇 arXiv 论文提出了不同的方法,包括规范化多模态学习中的模态贡献漂移、采用参数高效门控适应以及利用无梯度进化算法。其他方法则侧重于具有无梯度路由的紧凑型潜在空间适配器,以及在零空间中优化状态空间模型以在顺序任务中保留知识。
-
DM3D:动态Mamba架构增强点云理解能力
研究人员开发了DM3D,一种新颖的动态Mamba架构,旨在增强点云理解能力。该方法通过自适应局部特征支持和状态传播,解决了现有状态空间模型(SSMs)的局限性,无需固定的token顺序。DM3D学习空间和序列偏移来调整特征采样,使tokens能够聚合更相关的局部上下文,并根据3D点距离改进信息传播。该模型在基准数据集上表现强劲,在ModelNet40和ScanObjectNN上实现了高精度,并在ShapeNetPart上取得了有竞争力的结果。
-
人工智能在眼科护理中的应用:数据、预处理和模型的协同发展
一篇近期的综述论文详细介绍了人工智能在彩色眼底摄影(CFP)分析领域中数据、预处理和模型技术的协同演进。该论文强调,CFP数据集已从小型、特定任务的集合发展为与电子健康记录(EHRs)集成的大型多模态资源。预处理方法已从基本的图像增强发展到复杂的神经数据工程流程,而建模则从传统的CNN转向了视觉基础模型和状态空间模型。作者们总结认为,未来在临床部署和泛化能力方面的进步将依赖于这三个组成部分的协同优化。
-
Mamba的状态空间模型为LLM提供线性时间和恒定内存
状态空间模型(SSM),特别是Mamba架构,为大型语言模型提供了比Attention机制更高效的替代方案。与Attention在输入长度上具有二次方时间和内存成本不同,SSM使用固定大小的状态,该状态逐个token更新,从而实现线性和恒定内存复杂度。这种效率使得SSM能够处理显著更长的上下文。Mamba通过引入选择性门控来增强传统SSM,使模型能够根据输入token动态调整其状态,从而选择性地记忆或遗忘信息。
-
新型混合模型结合CoLES和状态空间模型进行用户交易分析
研究人员开发了一种新颖的混合方法,用于用户交易事件序列的以用户为中心的建模,该方法结合了对比表示学习(CoLES)和状态空间模型(SSMs)。该方法通过利用Mamba(一种选择性SSM)来有效处理长距离依赖关系,解决了现有编码器(如RNN和Transformer)的局限性。在公共数据集上的实验表明,与独立的SSM基线相比,混合模型在性能上持续提升,并且收敛速度快2-3倍,可解释性分析突出了选择性事件过滤和信息性交易特征的识别。
-
新的DSSMs通过显式内存增强长序列建模能力
研究人员引入了延迟状态空间模型(DSSMs),这是对角线状态空间模型的扩展,旨在通过引入显式的延迟状态反馈来改进长序列建模。这种方法解决了传统SSMs将无界历史压缩到固定状态的局限性,而这种局限性阻碍了在长上下文中的精确检索。DSSMs通过新的稳定性参数化、历史管理和FFT训练工具来实现这一点,使其在目标延迟检索任务上优于现有模型,并在标准序列指标上保持强劲性能。
-
新的狄利克雷过程缓存存储独特信息,性能优于注意力机制
研究人员为序列模型开发了一种新颖的记忆系统,该系统存储独特信息而非单个标记,解决了固定状态模型的局限性和注意力机制的计算成本问题。该系统基于可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使其能够随着遇到的独特项目数量进行扩展。实验表明,这种方法在显著减少内存使用量的情况下,匹配了全注意力机制的召回性能,尤其是在处理长而冗余的数据流时。
-
新型视觉SSM消除方向扫描,提升图像识别能力
研究人员推出了一种新颖的二阶非因果状态空间模型(SSM),名为Vision Non-Causal Trapezoidal Mamba (VNCT),专为视觉识别任务设计。与依赖方向性标记扫描的先前视觉SSM不同,VNCT在单次传递中同时处理所有图像标记,消除了方向偏差并降低了推理延迟。这种方法产生了更具方向鲁棒性的表示,从而在ImageNet-1K分类、COCO目标检测和ADE20K语义分割等基准测试中取得了更好的性能,尤其是在需要精…
-
通过代码和类比解释反向传播和矩阵微积分
本文解释了反向传播和矩阵微积分在深度学习中的数学概念。它使用工厂装配线的类比来说明如何通过反向传播识别和纠正错误,这类似于神经网络中梯度的计算。解释中详细介绍了用于进行预测的前向传播、代表客户不满意的损失函数,以及通过层追溯错误以使用梯度下降调整参数的反向传播。
-
MuonSSM框架增强了用于序列建模的状态空间模型 · 跟踪到2个来源
研究人员推出MuonSSM,一个旨在提高状态空间模型(SSM)在序列建模任务中的稳定性和性能的新框架。通过关注内存更新的几何形状而非循环转移矩阵的条件,MuonSSM旨在克服长期序列中的不稳定性与内存退化等问题。该框架包含一个基于动量的路径和一个牛顿-舒尔茨变换,理论上改善了梯度传播和谱条件。在各种基准测试中的实验结果表明,当MuonSSM集成到不同的SSM架构中时,在准确性、鲁棒性和长上下文性能方面取得了持续的提升。
-
高阶FNO改进了用于非线性偏微分方程的神经网络算子 · 跟踪2个来源
研究人员推出了高阶傅里叶神经网络算子(HO-FNO),这是对傅里叶神经网络算子(FNO)的改进,旨在更好地处理非线性偏微分方程(PDE)。HO-FNO包含显式的n重线性模式混合能力,能够捕捉非线性偏微分方程特有的模式之间的结构化交互。实验表明,HO-FNO在保持FNO效率的同时,性能优于其他谱神经网络算子,并在泊松方程等高度非线性场景中与最先进的Transformer和状态空间模型相媲美。