研究人员推出了一种新颖的全局-自我模型(World-Ego Model, WEM),用于生成具身智能体执行长时程导航和操作任务的视频。WEM将环境演变(全局)的预测与其动作(自我)的预测分离开来,解决了保持场景一致性和准确遵循指令的挑战。该模型结合了视觉-语言状态预测器、角色条件注意力以及语义路由的专家混合扩散生成器。为了便于评估,研究团队还开发了HTEWorld,这是一个包含超过125,000个视频片段和300个评估轨迹的新数据集和基准。 AI
影响 引入了一种新的具身AI视频生成方法,有望提高机器人导航和操作能力。
排序理由 这是一篇详细介绍新模型和数据集的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →