PulseAugur
中
实时 17:54:57
实体 State space models: Univariate representation of a multivariate model, partial interpolation and periodic convergence

State space models: Univariate representation of a multivariate model, partial interpolation and periodic convergence

PulseAugur coverage of State space models: Univariate representation of a multivariate model, partial interpolation and periodic convergence — every cluster mentioning State space models: Univariate representation of a multivariate model, partial interpolation and periodic convergence across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
14
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 14
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 19 条
  1. TOOL · CL_277243 ·

    新研究揭示混合Transformer-SSM模型中的学习率迁移

    一篇新研究论文探讨了混合架构的学习率(LR)缩放问题,该架构结合了Transformer和状态空间模型(SSM)模块,这些模块越来越多地用于生产语言模型中。研究发现,这些混合模型的实际实现,即使使用了简化的SSM,在各种宽度和深度下(高达十亿参数规模)也表现出接近零的学习率迁移差距。这种不变性归因于$\mu$P的初始化和学习率缩放,以及AdamW的逐参数归一化,它们共同维持了全局更新到权重的 Invariance 和局部组件的平衡。

  2. TOOL · CL_174319 ·

    新框架使用世界模型推理对耳廓CT扫描进行详细分割

    研究人员开发了一个名为AuricularWorld的新框架,用于分割CT扫描中的细粒度耳廓结构。该方法采用基于世界模型的方法和循环状态空间模型,通过迭代推理解剖结构,超越了传统的前馈预测。该框架引入了分层解剖动作,以逐步优化潜在表示,从而提高了分割精度,并显著降低了具有挑战性的耳廓结构的误差。

  3. TOOL · CL_129087 ·

    Lacuna Inc. 在 SemEval-2026 上发布新型叙事相似度模型

    Lacuna Inc. 为 SemEval-2026 任务 4 开发了不变-变分解耦状态空间模型 (IVD-SSM),该任务侧重于叙事相似度。该模型利用混合状态空间模型 Jamba-1.5-Mini,以避免标准 Transformer 的计算瓶颈。引入了一个名为结构化门控对齐 (SGA) 头的新组件,它将结构不变性与词汇变体解耦,以提高深度叙事理解能力。

  4. TOOL · CL_104717 ·

    新研究将 Transformer 路径病理与通用路由机制联系起来

    arXiv 上的一篇新论文提出,像注意力汇聚点(attention sinks)和表征塌陷(representation collapse)这样的常见 Transformer 病理并非注意力机制独有,而是内容路由在固定相似度度量下的固有缺陷。该研究将 softmax 注意力重新定义为欧氏距离上的玻尔兹曼加权聚合,并提出路由与表征不匹配的路由器会导致路由集中并使表征塌陷。这种现象在包括 Transformer、图注意力(graph at…

  5. RESEARCH · CL_50599 ·

    新的“睡眠”机制增强了 LLM 的长上下文处理能力

    研究人员提出了一种新颖的、类似“睡眠”的巩固机制,用于基于 Transformer 的大型语言模型,以解决注意力机制在上下文长度上扩展性差的问题。该方法包括定期将近期上下文转换为持久的快速权重并清除键值缓存。在“睡眠”期间,模型执行离线循环传递来更新状态空间模型块,将计算转移到此阶段,同时保持推理速度。该方法在需要更深层推理的任务上显示出改进的性能,特别是随着睡眠时间的增加。

  6. TOOL · CL_44923 ·

    新的内存分页技术提高了混合式大语言模型推理效率

    研究人员开发了一种名为非对称虚拟内存分页(AVMP)的新内存管理技术,以提高混合式语言模型的效率。这些模型结合了Transformer层和状态空间模型(SSM),导致存在当前系统处理不佳的独特内存缓存类型。AVMP将这些缓存类型分离到不同的池中,并在需要时允许它们之间的容量迁移,从而减少内存不足事件并显著提高请求吞吐量。

  7. RESEARCH · CL_42474 ·

    Deformba 方法增强了用于视觉任务的状态空间模型

    研究人员推出了一种新颖的上下文自适应方法 Deformba,旨在增强状态空间模型(SSM)在视觉任务中的应用。Deformba 通过动态增强空间结构信息同时保持线性复杂度来解决现有视觉 SSM 的局限性,并实现了跨注意力等多模态融合能力。该方法在各种 2D 视觉任务(包括图像分类、目标检测和分割)以及 3D 视觉任务(如 BEV 感知)中均表现出强大的性能。

  8. TOOL · CL_36599 ·

    Looped SSMs 通过深度递归提升时间序列分类性能

    研究人员推出了一种新颖的状态空间模型(SSM)方法——Looped SSMs,用于时间序列分类。该方法通过应用深度递归来提高性能,其中模型块跨层重用,类似于循环 Transformer。研究还强调了输入重塑技术(如连接或展平时间步)的显著优势,这些技术进一步提高了准确性。

  9. TOOL · CL_30805 ·

    量子记忆方法增强长序列令牌建模

    研究人员开发了QLAM,一种新颖的混合量子-经典记忆机制,旨在增强长序列令牌建模。QLAM将隐藏状态表示为量子态,利用叠加来编码历史信息并实现非经典、全局条件更新。该方法旨在保持状态空间模型的效率,同时丰富其捕获复杂依赖关系的记忆容量。在展平为令牌序列的图像分类基准上的评估表明,QLAM的表现优于循环模型和基于Transformer的模型。

  10. RESEARCH · CL_34499 ·

    新的注意力方法应对大语言模型长上下文挑战

    研究人员正在开发新的注意力机制来处理大型语言模型中日益增长的长上下文。一种方法,Runtime-Certified Bounded-Error Quantized Attention,使用分层 KV 缓存来压缩内存,同时保证回退到精确注意力,确保语言建模和检索等任务的质量。另一种方法,DashAttention,采用可微分稀疏分层注意力来适应性地选择相关 token,以与全注意力相当的准确性实现高稀疏度,并提供优于现有分层方法的性能。…

  11. TOOL · CL_25583 ·

    循环模型因误差动力学而在状态跟踪方面失败

    研究人员引入了一种关于循环神经网络架构中状态跟踪的新视角,强调误差控制动力学而非理论表达能力。他们证明了仿射循环网络(包括状态空间模型和线性注意力)由于无法在状态分离子空间上纠正误差,因此在鲁棒状态跟踪方面存在困难。这种限制导致了由累积误差决定的有限视界解决方案,并且随着可区分性比率跨越临界阈值,跟踪精度会可预测地下降。

  12. RESEARCH · CL_20526 ·

    新论文证明AI模型面临“不可能性三角”权衡

    研究人员发现长上下文模型中存在根本性的权衡,证明没有单一架构能够同时实现效率、紧凑性和召回率。该研究使用在线序列处理器(Online Sequence Processor)抽象形式化了这一“不可能性三角”,该抽象统一了各种现有模型,如Transformers和状态空间模型。数学不等式表明,优先考虑效率和紧凑性的模型在回忆历史信息的能力方面受到限制,这一发现已通过在合成召回任务上的实验得到验证。

  13. TOOL · CL_18843 ·

    新方法对齐状态空间模型归纳偏倚以提高数据效率

    研究人员开发了一个新框架,用于对齐状态空间模型(SSM)的归纳偏倚以提高数据效率。这种称为任务相关初始化(TDI)的方法,在训练前将模型的初始偏倚与任务的光谱特征相匹配。TDI 已被证明可以增强泛化能力,尤其是在默认SSM偏倚与任务底层结构不匹配的情况下。

  14. TOOL · CL_15589 ·

    SSMProbe 框架揭示了 token 顺序在视觉表示中的重要性

    研究人员开发了 SSMProbe,这是一个用于分析 AI 模型中视觉表示的新框架。该方法利用状态空间模型 (SSM) 来解释 token 顺序的关键作用,挑战了将 patch 表示视为非结构化数据的传统方法。SSMProbe 证明了 token 的顺序对性能有显著影响,尤其是在使用学习到的软排列来利用表示中这种依赖于顺序的异质性时。

  15. RESEARCH · CL_14356 ·

    新的AI模型利用先进技术解决图像和视频恢复问题

    研究人员开发了几种用于图像和视频恢复任务的新方法。一种方法,连续专家组装(CEA),使用动态参数化框架来适应图像中多样的局部退化模式。另一种方法集成了SAM2等分割模型,以获得可区分区域的先验知识,从而实现更准确的视频帧插值。此外,还创建了一个用于评估严重折射变形下多帧图像恢复的基准,并且一个混合Transformer-状态空间模型框架旨在提高边缘硬件上的恢复效率。

  16. RESEARCH · CL_09762 ·

    PKS4扫描器提供高效视频理解,训练计算量降低10倍

    研究人员推出了一种新颖的高效视频理解方法PKS$^4$,该方法解决了长视频序列的计算挑战。该方法集成了即插即用模块和线性复杂度的时域扫描,无需计算量大的注意力机制和多层适配器。PKS$^4$提取运动学先验来指导状态空间模型,实现自适应状态跟踪,与现有的视频SSM相比,训练计算量显著降低约10倍,同时在动作识别基准测试中取得了最先进的结果。

  17. RESEARCH · CL_05127 ·

    StateX 框架通过训练后状态扩展提升 RNN 记忆能力

    研究人员开发了 StateX,一个旨在提高循环神经网络 (RNN) 记忆能力的训练后框架。该方法在不显著增加模型参数的情况下,有效地扩展了预训练 RNN(如线性注意力模型和状态空间模型)的状态。实验表明,StateX 在高达 13 亿参数的模型中提升了记忆能力和上下文学习性能,同时不影响其他功能。

  18. RESEARCH · CL_01131 ·

    Apple研究人员在ICLR 2026上发布并行RNN训练和增强SSM

    Apple研究人员正在ICLR 2026上展示新成果,重点关注循环神经网络(RNN)和状态空间模型(SSM)的进步。他们的论文“ParaRNN”介绍了一个并行化训练框架,使大规模RNN能够实现与Transformer相媲美的性能,并已将代码库开源。另一篇论文“To Infinity and Beyond”表明,虽然SSM提供了效率,但由于内存有限,其在长文本生成任务上的性能会下降,而通过访问外部工具可以克服这一限制。

  19. RESEARCH · CL_04837 ·

    Mamba 模型提供 Transformer 级别的性能,同时具有更快的推理速度和更长的上下文

    Mamba 是一种新的状态空间模型 (SSM),为人工智能领域占主导地位的 Transformer 架构提供了一种替代方案。它旨在匹配 Transformer 的性能和扩展定律,同时高效处理极长的序列,可能长达一百万个 token。这是通过消除 Transformer 注意力机制中的二次方瓶颈来实现的,从而实现更快的推理速度和与序列长度的线性扩展。Mamba 在语言、音频和基因组学等各种模态中都取得了最先进的结果,其性能优于同等甚至更…