PulseAugur
中
实时 18:01:48
实体 video diffusion transformer

video diffusion transformer

PulseAugur coverage of video diffusion transformer — every cluster mentioning video diffusion transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_227247 ·

    LayerRecall 改进视频生成一致性,通过选择性记忆路由

    研究人员开发了 LayerRecall,这是一种新颖的记忆路由器,旨在提高视频生成模型中的长时一致性。该系统选择性地将历史记忆注入视频扩散 transformer 的特定层,解决了在长序列中保持主体和场景连续性的挑战。LayerRecall 利用跨视域预测匹配 (CHPM) 来训练记忆路由器,而无需大量标记数据,在 MemoBench 和 MovieBench 等基准测试中取得了强劲的性能。

  2. RESEARCH · CL_216150 ·

    新技术增强视频扩散 Transformer 的质量和压缩性能

    研究人员探索了增强视频扩散 Transformer (DiTs) 的新颖方法。一项研究引入了结构化激活引导 (STAS) 技术,这是一种无需训练的技术,通过操纵“海量激活值”(MAs) 来充当残差计算的隐式重定标器,从而提高视频质量和时间连贯性。另一篇论文提出了 DiffVC-ONE,一个基于扩散的生成视频压缩框架,它利用单步视频扩散 Transformer 实现高效压缩和感知增强,以低推理成本实现了最先进的结果。

  3. RESEARCH · CL_180972 ·

    新的交互式视频世界模型框架出现

    研究人员推出了两个新的视频世界模型框架,这对于具身AI和交互式模拟至关重要。第一个框架HelloWorld通过允许角色响应诸如转弯或挥手之类的提示,实现了用户与视频环境中的角色之间的社交互动。它利用了自蒸馏管道和新颖的推理模块来实现响应的时间局部化。第二个框架MiniWorld旨在通过提供一个轻量级、可复现的系统,该系统可以在适度的计算资源上从头开始训练,从而实现这些模型的训练民主化。MiniWorld采用了块因果视频扩散Transf…

  4. TOOL · CL_156640 ·

    Timeripple 通过利用潜在空间中的相关性来加速视频扩散 Transformer

    研究人员开发了一种名为 Timeripple 的新方法来加速视频扩散 Transformer (vDiTs),该方法常用于视频生成。该方法利用了这些模型潜在空间中固有的时空相关性。通过重用相关标记的部分注意力分数,Timeripple 可将计算成本显著降低高达 85%,同时保持几乎相同的视频质量。

  5. RESEARCH · CL_154690 ·

    AlayaWorld 以 720p 生成能力推动交互式视频世界建模

    研究人员推出了 AlayaWorld,这是一个交互式视频世界模型,能够以 540p 和 720p 的分辨率生成 24 fps 的视频。该模型使用了一个 15B 的视频扩散 Transformer,并结合了多种机制来在长时域内保持时空一致性和稳定性,包括压缩时域历史和几何对齐的空间记忆。AlayaWorld 还采用了一种离散自回归蒸馏方法来显著缩短推理时间。另外,一篇关于 WorldPack 的论文提出了一种用于长上下文视频世界建模的动…

  6. RESEARCH · CL_93922 ·

    Track2View 利用3D点轨迹实现先进的相机控制视频生成

    研究人员开发了Track2View,一种从新相机视角生成视频的新颖方法。该方法利用3D点轨迹建立明确的时空对应关系,确保时间连续性并提高视觉质量。Track2View 使用配对的3D点轨迹来条件化视频扩散Transformer,使其能够泛化到各种相机轨迹而无需记忆特定运动。该系统在400个视频的基准测试中展示了最先进的性能,与现有方法相比,显著降低了旋转和平移误差。

  7. RESEARCH · CL_50748 ·

    新AI框架增强自动驾驶场景生成

    研究人员推出多个用于生成逼真且可控驾驶场景的新框架,这对于训练自动驾驶汽车至关重要。DriveWAM将视频扩散Transformer适配到自回归动作策略的创建中,整合了场景理解和记忆以实现长时规划。AnyScene提供了一个统一的以占用为中心的模型,能够从任意BEV布局进行精确控制,并生成时间上一致的多视图视频。DriveGen3D结合了高效视频扩散与3D场景重建,用于高质量、可控的动态场景,支持长驾驶视频和3D表示。此外,还策划了一…