研究人员推出了一种名为 ShadowDancer 的新方法,用于在帧级别上用任何动作控制交互式视频世界模型。该方法解决了从演示视频中学习动作的挑战,而演示视频通常只捕捉底层动力学的单一外观。ShadowDancer 利用“阴影对”——重播相同动力学但独立重采样外观的视频——来构建统一的动力学表示。通过跨阴影预测来学习动作,模型可以丢弃特定于外观的细节并保留核心动力学,从而实现更好的动作迁移到新场景。实验表明,ShadowDancer 在动作迁移和长动作回放方面优于现有基线。 AI
影响 通过学习统一的动力学表示,实现了对视频世界模型更通用和可迁移的控制。
排序理由 研究论文,详细介绍了一种用于视频世界模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →