研究人员推出VIPER框架,旨在提高生成视频的物理可信度。VIPER利用多模态大语言模型(MLLM)从参考视频中提取与物理相关的线索,然后指导标准的图像到视频生成器。这种方法可以在不需要复杂文本提示的情况下,将材料响应和运动轨迹等物理行为迁移到新场景中。为此,创建了一个名为VIPER-19K的新数据集,其中包含材料属性、轨迹和物理碰撞的标注。 AI
影响 增强了对AI生成视频中物理真实性的控制,可能带来更可信的合成媒体。
排序理由 该集群描述了一篇关于视频生成新框架和数据集的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →