video diffusion transformer
PulseAugur coverage of video diffusion transformer — every cluster mentioning video diffusion transformer across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
MiniWorld 框架使视频世界模型训练民主化
研究人员推出了 MiniWorld,一个旨在简化从头开始训练视频世界模型的新框架。该系统利用了在 Video VAE 的潜在空间内使用 Flow Matching 进行训练的块因果视频扩散 Transformer。MiniWorld 以其效率而著称,能够在几天内在一台 8-GPU 服务器上进行训练,并通过提供一个可访问且可复现的基线,旨在使具身人工智能和交互式模拟的研究民主化。
-
Timeripple 通过利用潜在空间中的相关性来加速视频扩散 Transformer
研究人员开发了一种名为 Timeripple 的新方法来加速视频扩散 Transformer (vDiTs),该方法常用于视频生成。该方法利用了这些模型潜在空间中固有的时空相关性。通过重用相关标记的部分注意力分数,Timeripple 可将计算成本显著降低高达 85%,同时保持几乎相同的视频质量。
-
AlayaWorld 以 720p 生成能力推动交互式视频世界建模
研究人员推出了 AlayaWorld,这是一个交互式视频世界模型,能够以 540p 和 720p 的分辨率生成 24 fps 的视频。该模型使用了一个 15B 的视频扩散 Transformer,并结合了多种机制来在长时域内保持时空一致性和稳定性,包括压缩时域历史和几何对齐的空间记忆。AlayaWorld 还采用了一种离散自回归蒸馏方法来显著缩短推理时间。另外,一篇关于 WorldPack 的论文提出了一种用于长上下文视频世界建模的动…
-
Track2View 利用3D点轨迹实现先进的相机控制视频生成
研究人员开发了Track2View,一种从新相机视角生成视频的新颖方法。该方法利用3D点轨迹建立明确的时空对应关系,确保时间连续性并提高视觉质量。Track2View 使用配对的3D点轨迹来条件化视频扩散Transformer,使其能够泛化到各种相机轨迹而无需记忆特定运动。该系统在400个视频的基准测试中展示了最先进的性能,与现有方法相比,显著降低了旋转和平移误差。
-
新AI框架增强自动驾驶场景生成
研究人员推出多个用于生成逼真且可控驾驶场景的新框架,这对于训练自动驾驶汽车至关重要。DriveWAM将视频扩散Transformer适配到自回归动作策略的创建中,整合了场景理解和记忆以实现长时规划。AnyScene提供了一个统一的以占用为中心的模型,能够从任意BEV布局进行精确控制,并生成时间上一致的多视图视频。DriveGen3D结合了高效视频扩散与3D场景重建,用于高质量、可控的动态场景,支持长驾驶视频和3D表示。此外,还策划了一…