研究人员开发了OmniCam,这是一种新颖的自回归模型,旨在为视频生成、场景重建和机器人感知生成相机轨迹。该模型采用几何约束的姿态令牌学习方法,结合了全景点云编码器、混合绝对旋转和相对平移令牌化,以及带有3D目标锚点的独立几何和语义条件流。还构建了一个包含超过267,000条轨迹的新数据集OmniCaT来评估OmniCam,该模型在轨迹误差和碰撞率方面均显著优于现有方法。 AI
影响 该模型可以提高AI生成视频的真实感和可控性,并增强机器人感知系统。
排序理由 这是一篇详细介绍新模型和数据集的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →