研究人员开发了MVHOI,一个新颖的两阶段框架,用于复杂的人-物交互(HOI)视频重演。该系统通过利用3D基础模型,将多视角条件桥接到复杂的HOI场景。该框架首先提取隐式运动动力学,并使用运动驱动对象先验模块从多视角参考中预测对象的方向和外观。随后,一个基于Diffusion Transformer的视频生成模型利用这些预测进行逼真的视频合成,在对象保真度和交互真实性方面优于现有方法。 AI
影响 这项研究推动了视频重演能力的发展,可能对合成媒体生成和虚拟试穿应用产生影响。
排序理由 该集群描述了一篇详细介绍新颖视频重演框架的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- 3D Foundation Model
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Diffusion Transformer
- Gotit.pub
- Hugging Face
- Jinguang Tong
- Motion-Driven Object Prior
- MVHOI
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →