PulseAugur
实时 13:57:00
English(EN) Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

新的RAD框架通过全局记忆和局部注意力增强长视频生成

研究人员引入了一个名为循环自回归扩散(RAD)的新框架,旨在改进长视频生成。RAD将时间循环神经网络(RNN)层(特别是LSTM)集成到扩散Transformer模型中,以增强长视频序列的记忆压缩和检索。这种方法解决了先前模型使用滑动窗口注意力所存在的局限性,这些模型由于遗忘和时空不一致性而在长期一致性方面遇到困难。在Memory Maze和Minecraft数据集上的实验表明,RAD在生成具有全局记忆和局部注意力的长视频方面是有效的。 AI

影响 这个新框架可能导致更连贯、更一致的长篇视频生成,影响动画和内容创作等领域。

排序理由 这是一篇详细介绍视频生成新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的RAD框架通过全局记忆和局部注意力增强长视频生成

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin ·

    循环自回归扩散:全局记忆与局部注意力相结合

    arXiv:2511.12940v2 Announce Type: replace Abstract: Recent advancements in video generation has shifted from bidirectional models for short videos to autoregressive ones for ultra long video generation. Previous models, which usually use sliding window attention to restrict infer…