实体
V-RAE
V-RAE
PulseAugur coverage of V-RAE — every cluster mentioning V-RAE across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
V-RAE 通过使用冻结的语义表示来推进视频生成
研究人员推出了 V-RAE,这是一种新颖的视频表示自编码器,旨在改进潜在视频生成。与优化像素级重建的先前模型不同,V-RAE 使用冻结的视觉基础模型表示来构建紧凑的生成潜在表示。这种方法有效地消除了时间冗余,同时保留了语义结构,从而在视频重建、生成和预测任务中取得了卓越的性能。V-RAE 在 K600 和 UCF101 等基准测试中取得了最先进的成果,证明了语义表示对于有效的视频生成建模至关重要。
-
新基准和方法推动视频生成模型评估
研究人员推出了 VGI-BENCH,这是一个旨在评估视频生成模型视觉智能的新基准。该基准包含 27 个任务和 810 个实例,旨在评估超越仅生成逼真最终帧的推理能力。初步评估显示,即使是 Seedance 2.0 等先进模型也只能达到 51.0% 的准确率,这表明在内部错误纠正和对输入条件的敏感性等方面仍有很大的改进空间。同时,提出了一种名为 V-RAE 的新方法,该方法利用冻结的视觉表示来创建用于视频生成的语义组织潜在空间,从而实现…