VBench-Long
PulseAugur coverage of VBench-Long — every cluster mentioning VBench-Long across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
WorldAttention架构通过新颖的注意力和缓存提高了视频模型效率
研究人员推出了一种新颖的注意力架构WorldAttention,旨在提高交互式视频世界模型的效率。该系统解决了当前方法的局限性,这些方法要么通过滑动窗口牺牲历史上下文,要么因全历史缓存而导致计算成本过高。WorldAttention采用混合稀疏注意力(Hybrid Sparse Attention)和分层KV缓存(Hierarchical KV Cache)来有效管理历史数据,能够在不产生过高内存或计算需求的情况下利用长程上下文。该架…
-
新方法应对长视频生成中的时间退化问题 · 跟踪到2个来源
两篇新的研究论文提出了通过管理自回归视频扩散模型中使用的历史键值(KV)内存来改进长视频生成的方法。DensityKV使用Soft-Riesz密度来衡量键之间的局部冗余,在不牺牲连贯性的情况下限制累积。Relax Forcing将时间上下文分解为不同的帧类型(Sink、Tail、History),并使用基于松弛的标准来选择历史帧,从而保持运动动态并减少注意力开销。这两种方法都旨在减轻长视频生成中的时间退化和错误传播。
-
LayerRecall 改进视频生成一致性,通过选择性记忆路由
研究人员开发了 LayerRecall,这是一种新颖的记忆路由器,旨在提高视频生成模型中的长时一致性。该系统选择性地将历史记忆注入视频扩散 transformer 的特定层,解决了在长序列中保持主体和场景连续性的挑战。LayerRecall 利用跨视域预测匹配 (CHPM) 来训练记忆路由器,而无需大量标记数据,在 MemoBench 和 MovieBench 等基准测试中取得了强劲的性能。
-
MLLM 通过语义校正和视觉规划增强文本到视频生成
两篇新的研究论文探讨了通过整合多模态大语言模型(MLLM)和扩散模型来增强文本到视频生成。第一篇论文介绍了一个框架,该框架将 MLLM 反馈直接注入扩散采样循环中进行中间生成语义校正,在不改变模型参数的情况下提高对齐度和保真度。第二篇论文系统地研究了 MLLM 和扩散 Transformer(DiT)的融合,发现自回归生成且显式以 DiT 为条件的离散语义视觉标记比提示精炼更有效。这种称为 BiVidGen 的方法展示了改进的语义对齐…
-
Alaya-EVOKE 推出交互式世界模型,用于开放式视频生成
研究人员推出了 Alaya-EVOKE,一个专为开放式视频生成设计的交互式世界模型。该模型利用外部持久内存和一种新颖的长时域教师来实现低延迟的响应式生成。Evoke 通过外部化世界状态并重新设计教师以实现扩展监督,解决了维护历史和实现低延迟交互的挑战,在 WBench 等基准测试中取得了最先进的性能。
-
新框架通过自适应资源分配增强长视频生成
研究人员开发了一个名为“惊喜强制”(Surprise Forcing)的新框架,以改进扩散模型生成长视频的性能。该方法解决了当前流式自回归扩散模型在有界上下文和固定去噪时间表方面的局限性。惊喜强制通过使用“惊喜门控记忆库”(Surprise-Gated Memory Bank)来总结被驱逐的帧,以及一个基于块难度的去噪步骤调整的“惊喜感知去噪”(Surprise-Aware Denoising)过程,来优化资源分配。在VBench等基…
-
新方法提升自回归视频生成质量和效率
研究人员正在开发新方法来改进自回归视频生成,重点关注效率和质量。一种名为 One-Forcing 的方法结合了 DMD 目标和 GAN 损失,实现了稳定、高质量的一步视频生成,在基准测试中优于现有的一步法。另一种技术 DySink 使用基于检索的框架和动态帧接收器来保持自适应的远程上下文,并防止长视频生成崩溃。此外,对抗性流蒸馏 (AFD) 提供了一种策略内方法,可以将异构黑盒视频生成器蒸馏成高效的自回归学生模型,而无需教师分数。
-
Pyramid Forcing 通过头部感知的缓存策略改进长视频生成
研究人员推出了一种新颖的 KV 缓存策略 Pyramid Forcing,旨在提高长视频生成的质量。该方法通过认识到模型中不同的注意力头对历史帧有不同的依赖关系,从而解决了自回归视频合成中累积误差的问题。Pyramid Forcing 将这些头部分为 Anchor、Wave 和 Veil 类型,并为每种类型分配定制的缓存策略,以优化上下文保留并减少在较长生成范围内的退化。实验证明,在运动动力学、视觉保真度和语义一致性等视频质量指标方面…