PulseAugur
实时 10:11:24
English(EN) MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI框架使用3D基础模型进行复杂人-物交互视频重演

研究人员开发了MVHOI,一个新颖的两阶段框架,用于复杂的人-物交互(HOI)视频重演。该系统通过利用3D基础模型,将多视角条件桥接到复杂的HOI场景。该框架首先提取隐式运动动力学,并使用运动驱动对象先验模块从多视角参考中预测对象的方向和外观。随后,一个基于Diffusion Transformer的视频生成模型利用这些预测进行逼真的视频合成,在对象保真度和交互真实性方面优于现有方法。 AI

影响 这项研究推动了视频重演能力的发展,可能对合成媒体生成和虚拟试穿应用产生影响。

排序理由 该集群描述了一篇详细介绍新颖视频重演框架的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

MVHOI框架使用3D基础模型进行复杂人-物交互视频重演

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li ·

    MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

    arXiv:2603.14686v2 Announce Type: replace Abstract: Human-Object Interaction (HOI) video reenactment aims to transfer the interaction dynamics of a source video to a novel target object while preserving realistic hand-object coordination. Existing methods typically rely on sparse…