研究人员开发了 DAR,这是一种新颖的方法,使预训练的视频扩散模型能够充当 4D 渲染器。该方法使用动画网格、相机轨迹和参考图像来约束这些模型,从而实现考虑相机运动和内部对象动画的场景生成。DAR 投影一个神经 4D G-缓冲区,其中包含跟踪、世界位置和法线信息,然后通过加宽的控制适配器将其集成到模型中。在 DAR-4D 基准测试上的评估表明,与 Wan2.2-Depth 等现有方法相比,PSNR、SSIM 和 LPIPS 有显著提高。 AI
影响 这项研究可以通过利用现有的视频扩散模型,实现更复杂的 4D 内容生成和操作。
排序理由 该项目是一篇研究论文,详细介绍了一种使用视频模型进行 4D 渲染的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- camera trajectory
- CatalyzeX
- DagsHub
- DAR-4D benchmark
- Gotit.pub
- Hugging Face
- ScienceCast
- video diffusion models
- Wan2.2
- Wan2.2-Depth
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →