研究人员推出IGGT4D,这是一种新颖的流式实例感知几何Transformer,专为从连续视频进行实时4D场景理解而设计。该模型按顺序处理视频帧,通过逐步更新相机运动、几何和对象身份的表示来保持时间一致性和对象级理解。为了支持这项研究,创建了一个名为InsScene4D-147K的大规模数据集,其中包含通过自动化标注管道生成的各种场景和对象掩码。实验表明,与现有的流式方法相比,IGGT4D在3D重建和开放词汇分割等任务中表现更优。 AI
影响 这项研究推动了实时4D场景理解的发展,有望改善机器人和自主系统中的应用。
排序理由 详细介绍新型模型和数据集的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →