PulseAugur
实时 07:42:06
实体 VideoMAEv2

VideoMAEv2

PulseAugur coverage of VideoMAEv2 — every cluster mentioning VideoMAEv2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_145738 ·

    VideoRAE 利用 VFM 特征改进视频生成

    研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强视频生成模型。该系统利用了 V-JEPA 2 和 VideoMAEv2 等冻结的视频基础模型 (VFM) 的特征,将它们压缩成适合生成任务的紧凑潜在表示。VideoRAE 同时支持用于扩散 Transformer 的连续潜在表示和用于自回归模型的离散标记,在 UCF-101 数据集上展示了最先进的性能,并且比现有方法收敛更快。

  2. TOOL · CL_152126 ·

    VideoRAE 利用冻结的基础特征增强生成式视频模型

    研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强生成式视频建模。与专注于像素级重建的传统方法不同,VideoRAE 利用来自 V-JEPA 2 和 VideoMAEv2 等冻结视频基础模型的多尺度分层特征。这种方法可以创建紧凑、有利于生成的潜在空间,支持 Diffusion Transformers 的连续潜在变量和自回归模型的离散标记。实验表明,VideoRAE 实现了最先进的重建质量,并且比现有的自编码器基线收…

  3. TOOL · CL_36095 ·

    潜在视频模型展现出强大的世界建模能力

    一项新研究系统地评估了四种前沿视频基础模型:V-JEPA 2.1、V-JEPA 2、VideoPrism 和 VideoMAEv2,涵盖了与其作为世界模型相关的五个鲁棒性维度。研究发现,在特征可辨性、损坏鲁棒性、细粒度辨别、遮挡鲁棒性和时间方向编码方面,潜在预测模型始终优于其他模型。值得注意的是,一个冻结的 V-JEPA 2 主干模型在损坏和遮挡任务上的鲁棒性优于完全微调的模型,这表明潜在预测在鲁棒世界建模方面具有优势。