研究人员推出GeoWM,这是一种专为机器人和自动驾驶设计的新型世界模型,它直接预测未来的3D场景几何,无需依赖递归展开。该方法利用几何基础模型将RGB帧转换为几何历史,然后指导流匹配Transformer在指定的未来视界处预测几何。GeoWM还包含一个相机运动预测器来估计未来的视点,增强其预测的几何先验。跨不同数据集的实验表明,GeoWM在预测深度、相机姿态和3D场景几何方面表现优越,同时为更长的预测视界提供了显著缩短的推理时间。 AI
影响 该模型可以提高自动驾驶系统3D场景理解的效率和准确性。
排序理由 详细介绍新模型及其性能的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- camera-motion predictor
- flow-matching transformer
- geometry foundation model
- GeoWM
- Hugging Face
- RGB color model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →