State Space Model
PulseAugur coverage of State Space Model — every cluster mentioning State Space Model across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
SSM spectral fragility is a key research area
The research on segmentation models shows that SSMs exhibit dataset-dependent feature-spectral fragility, with performance degrading under low-pass filtering. This sensitivity, localized within the architecture, indicates that understanding and mitigating spectral vulnerabilities will be a critical area of investigation for improving SSM robustness.
State Space Models (SSMs) to see wider adoption in specialized vision tasks
The recent evidence shows SSMs are being integrated into specialized computer vision applications like dental image segmentation (FU-Mamba) and general segmentation tasks. The success of Cartesia's Sonic-3.6, which uses SSMs and achieves high performance, suggests that SSMs are becoming a viable and competitive architecture for specific domains beyond general sequence modeling.
SSM research to focus on hybrid architectures for improved global context
The InfoMamba paper highlights a hybrid approach combining SSMs with other mechanisms (concept bottleneck linear filtering) to overcome limitations in capturing global interactions, outperforming pure SSMs and Transformers. This suggests future research will likely explore similar hybrid models to leverage the strengths of SSMs while mitigating their weaknesses.
-
新研究通过收缩条件认证AI安全头的鲁棒性
研究人员开发了一种方法,可以形式化地认证语言模型中安全分类器的鲁棒性,特别是基于状态空间模型(SSMs)的模型。他们证明了状态转移矩阵上的一个关键条件,即收缩条件($ orm{A}_ ext{inf}<1$),对于精确区间边界传播(IBP)认证是必需的。当满足此条件时,可以认证安全头对扰动输入的预测一致性,并且研究人员在有毒评论数据上展示了改进的认证比例。将收缩正则化的S4头应用于越狱检测任务,在AdvBench和HarmBench等…
-
新研究揭示混合Transformer-SSM模型中的学习率迁移
一篇新研究论文探讨了混合架构的学习率(LR)缩放问题,该架构结合了Transformer和状态空间模型(SSM)模块,这些模块越来越多地用于生产语言模型中。研究发现,这些混合模型的实际实现,即使使用了简化的SSM,在各种宽度和深度下(高达十亿参数规模)也表现出接近零的学习率迁移差距。这种不变性归因于$\mu$P的初始化和学习率缩放,以及AdamW的逐参数归一化,它们共同维持了全局更新到权重的 Invariance 和局部组件的平衡。
-
URCHIN:一种用于数据受限预训练的生物启发式脉冲语言模型
研究人员开发了URCHIN,这是一种新颖的、用于数据受限预训练的脉冲语言模型。与传统模型不同,URCHIN 整合了生物学约束,使用了 leaky integrate-and-fire 神经元和循环侧向连接组。它在 BabyLM 挑战的多个赛道上取得了有竞争力的结果,其最小架构仅包含 128 个神经元和 4.23M 参数,可在 GPU 上实现高效训练,并为边缘部署提供恒定成本的推理。
-
新型RCL-Mamba模型增强了快速3D扫描的图像恢复能力
研究人员开发了RCL-Mamba,这是一种新颖的双域状态空间模型,旨在改进旋转扫描计算层析成像(RCL)的图像恢复。该方法解决了快速无损检测中常见的投影数据中的旋转模糊和图像重建中的稀疏伪影问题。通过采用级联联合处理策略和Mamba-CNN双分支模块,RCL-Mamba能有效校正模糊并抑制伪影,同时保留精细细节。评估表明,其性能显著优于现有方法,并且可以在不降低质量的情况下将扫描视图减少多达8倍,从而提高了印刷电路板等组件的检测效率。
-
新研究利用新颖架构解决手写字符识别问题
两篇新研究论文探讨了手写字符识别的进展。第一篇论文介绍了一种结合滑动窗口路径签名和线性循环单元(LRU)的框架,在识别旋转手写字符方面取得了高精度,在速度和准确性上均优于现有模型。第二篇论文提出了 GraphemeNet,一种多脚本架构,通过持久支架注入和笔画拓扑模块显式编码脚本-几何规律,展示了跨各种书写系统的结构先验效率。
-
新的基于Mamba的模型PPIM提高了三维生物传热模拟的准确性
研究人员开发了一种名为PPIM的新型物理信息神经网络模型,用于模拟生物组织中的热量分布。该模型基于Pennes生物传热方程,并采用了状态空间模型(SSM)架构,旨在提高三维生物传热模拟的准确性,特别是在涉及局部热源(如微波消融)的情况下。在与其他神经网络求解器和有限差分法的比较测试中,PPIM在预测温度场方面表现出优越的性能,误差主要集中在热源附近。
-
新的黎曼语言模型使困惑度提高2倍
研究人员推出了一种新颖的参数高效语言建模方法——黎曼语言模型(RiLM),该方法无需输出矩阵。该方法利用测地线解码,其中上下文在黎曼流形上作为轨迹展开,下一个词的概率由当前状态与词汇嵌入之间的测地线距离决定。在WikiText-2上的实验中,双曲变体(HypRiLM)的困惑度达到54.2,性能大约是绑定循环基线的两倍,并且显著优于平面流形实现。
-
AI拒绝机制被发现跨架构一致
研究人员发现,语言模型中的“拒绝”能力(AI安全的关键方面)是由模型内部运作中的一个单一方向控制的。这一最初在Transformer架构中观察到的发现,即使在信息处理机制不同的状态空间模型(SSMs)中也得以保留。研究表明,这种“拒绝方向”可以在不同架构之间对齐,从而使在一种模型类型上训练的安全工具能够有效地标记另一种模型中的有害输入。此外,研究表明,“写入点”(一个层在计算其输出后将其添加到主数据流之前的位置)对于读取这种安全表示至…
-
新型 SASG-SSM 模型提升组织病理学 WSI 分类性能
研究人员推出了一种名为语义感知子图状态空间模型(SASG-SSM)的新型框架,该框架专为组织病理学中的全切片图像(WSI)分类而设计。该模型通过近似语义单元(代表不规则形状的组织区域)并保留其内部空间组织,解决了传统基于块的方法的局限性。SASG-SSM 集成了图神经网络来编码子图内部拓扑,并结合了基于 Mamba 的状态空间编码器以实现跨多个子图的高效上下文关联,从而结合了局部结构和全局上下文信息。在四个 WSI 分型数据集上的实验…
-
分割模型显示出数据集依赖的特征谱脆弱性
一篇新研究论文探讨了计算机视觉中分割模型的脆弱性,重点关注它们对学习到的特征表示中频率内容的依赖性。该研究将低通滤波应用于 CNN、状态空间模型 (SSM) 和 Transformer 架构在 CVC-ClinicDB 和 ISIC2018 两个数据集上的内部表示。结果显示性能显著下降,尤其是在 CVC-ClinicDB 上,其严重程度因架构和数据集而异。研究还发现,对这些谱干预的敏感性位于特定架构的深度,并表明特征谱鲁棒性与输入域谱鲁棒性不同。
-
InfoMamba:无注意力混合模型性能超越Transformers和SSMs
一篇研究论文介绍了一种名为InfoMamba的无注意力混合架构,旨在平衡序列处理中的局部和长程依赖建模。该模型集成了选择性状态空间模型(SSM)流和用于全局上下文的概念瓶颈线性滤波层。InfoMamba旨在克服Transformers的二次复杂度以及传统SSMs在捕捉全局交互方面的局限性。实验表明,InfoMamba在多项任务上的表现优于现有的Transformer和SSM基线模型,同时保持近乎线性的扩展性。
-
FU-Mamba框架提升口腔扫描图像分割精度
研究人员开发了FU-Mamba,一个旨在改进数字牙科应用中口腔扫描图像分割的新型框架。该框架通过引入一种保留空间连续性的动态扫描方法和一个增强频率域的模块来提高对成像伪影的鲁棒性,从而解决了现有视觉状态空间模型的局限性。实验表明,FU-Mamba在牙科分割数据集上实现了平均交并比(mIoU)1.1%的提升,提高了诊断和治疗规划的准确性。
-
新的哈密顿谱推荐器模型模拟复杂用户行为动力学
研究人员推出了一种新颖的序列推荐方法——哈密顿谱推荐器(HSR),它使用二阶动力学系统来模拟用户偏好的演变。与将偏好变化视为一阶过程的现有模型不同,HSR 将这种演变概念化为潜在相空间中的耗散哈密顿系统,考虑了惯性、周期性和突然变化。该系统的线性时不变结构允许在频域中获得闭式解,而可学习的耗散机制和脉冲细化模块则捕捉了兴趣衰减和行为的突然波动。在基准数据集上的实验表明,HSR 的性能优于最先进的基于 Transformer 和状态空间…
-
Cartesia的Sonic-3.6模型位居AI排行榜榜首;Mistral AI建设欧洲基础设施 · 跟踪2个来源
Cartesia的Sonic-3.6模型在Artificial Analysis上取得了顶级排名,其状态空间模型架构的表现优于主要行业参与者,并实现了低于90毫秒的延迟。与此同时,法国公司Mistral AI正专注于数据主权,并开发1吉瓦的基础设施,以减少欧洲对美国科技巨头的依赖。
-
新型SIGMA-Lane模型改进了遮挡情况下的视频车道线检测
研究人员开发了SIGMA-Lane,一种新颖的视频车道线检测方法,解决了车辆遮挡带来的挑战。该方法在状态空间模型(SSM)框架内集成了感知遮挡的门控机制,以管理当前观测如何影响时间记忆并整合回预测中。通过采用SSM一致的双门控和结构化空间检索(SSR),SIGMA-Lane旨在增强时间稳定性和恢复缺失的车道线结构,在VIL-100和OpenLane-V等数据集上展示了改进的性能。
-
新的IR275K基准针对红外超分辨率挑战
研究人员推出了IR275K,这是一个新的基准数据集,旨在评估专门用于红外遥感应用的多帧超分辨率(MFSR)技术。该基准解决了红外数据的独特挑战,例如热对比度、传感器噪声和纹理较弱等现有数据集未能充分捕捉的问题。IR275K包含594个红外视频序列,共计275,196帧,以及标准化的X4评估协议。作为初步评估,论文测试了CGMamba,一种轻量级状态空间模型,证明了其有效性,并强调了空间锚定对这类模型在红外条件下的重要性。
-
新研究详细介绍了隔离式大模型代理中的信息遗漏问题
一篇题为《事实缺失之处》的新研究论文,提出了一种用于隔离式大模型代理管道中信息遗漏的分类法和归因方法。研究发现,高达73.4%的信息遗漏源于确定性中间件层,而非模型本身。研究还发现,增加上下文长度与更高的遗漏率密切相关。
-
HERMES模型利用图神经网络推进交通冲突预测
研究人员开发了HERMES,一种用于预测信号交叉口交通冲突的新型图神经网络。该模型将车辆和行人表示为异构节点,将它们之间的交互表示为关系特定的边,并结合了运动学和安全描述符。在检测冲突序列方面,HERMES在评估中表现优于Transformer和XGBoost基线模型,AUC-ROC达到0.9898,AUC-PR达到0.9412。
-
DevOps 工程师分享 10 种 Claude 提示模式以实现高效自动化
一位 DevOps 工程师分享了在使用 Claude 执行复杂自动化任务时学到的十种提示工程模式。该建议强调提供上下文、展示示例和指定约束以提高 AI 输出效率。关键策略包括解释请求背后的“原因”、演示所需的输出格式以及将所有要求整合到单个提示中,以避免反复修正。
-
FuseMamba-VD 推出用于视频暴力检测的高效双分支架构
研究人员推出 FuseMamba-VD,这是一种用于高效视频暴力检测的新型双分支架构。该模型结合了状态空间模型 (SSM) 主干和门控机制,以融合空间和时间特征,从而提高在具有挑战性的监控场景中的准确性。所提出的方法还通过合并几个现有数据集来引入新的基准,展示了最先进的性能以及准确性和计算效率之间的良好平衡。