PulseAugur
实时 04:02:48
English(EN) VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER框架使用MLLM改进视频生成中的物理效果

研究人员推出VIPER框架,旨在提高生成视频的物理可信度。VIPER利用多模态大语言模型(MLLM)从参考视频中提取与物理相关的线索,然后指导标准的图像到视频生成器。这种方法可以在不需要复杂文本提示的情况下,将材料响应和运动轨迹等物理行为迁移到新场景中。为此,创建了一个名为VIPER-19K的新数据集,其中包含材料属性、轨迹和物理碰撞的标注。 AI

影响 增强了对AI生成视频中物理真实性的控制,可能带来更可信的合成媒体。

排序理由 该集群描述了一篇关于视频生成新框架和数据集的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

VIPER框架使用MLLM改进视频生成中的物理效果

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang ·

    VIPER: 用于物理上可信视频生成的视觉上下文物理推理

    arXiv:2607.23472v1 Announce Type: new Abstract: Modern video generation models can synthesize visually compelling and temporally coherent clips, yet controlling their physical behavior remains difficult with standard text and image conditions. The core challenge is a conditioning…