实体
Video Foundation Models
Video Foundation Models
PulseAugur coverage of Video Foundation Models — every cluster mentioning Video Foundation Models across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
VideoRAE 利用 VFM 特征改进视频生成
研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强视频生成模型。该系统利用了 V-JEPA 2 和 VideoMAEv2 等冻结的视频基础模型 (VFM) 的特征,将它们压缩成适合生成任务的紧凑潜在表示。VideoRAE 同时支持用于扩散 Transformer 的连续潜在表示和用于自回归模型的离散标记,在 UCF-101 数据集上展示了最先进的性能,并且比现有方法收敛更快。
-
VideoRAE 利用冻结的基础特征增强生成式视频模型
研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强生成式视频建模。与专注于像素级重建的传统方法不同,VideoRAE 利用来自 V-JEPA 2 和 VideoMAEv2 等冻结视频基础模型的多尺度分层特征。这种方法可以创建紧凑、有利于生成的潜在空间,支持 Diffusion Transformers 的连续潜在变量和自回归模型的离散标记。实验表明,VideoRAE 实现了最先进的重建质量,并且比现有的自编码器基线收…