研究人员推出了一种名为SG-WAM的新方法,旨在提高机器人领域中世界-动作模型(WAM)的准确性。现有的WAM由于主要依赖视觉线索而非显式的语言基础,常常难以将预测的动作和未来视频与语言指令对齐。SG-WAM通过整合一个视觉-语言模型(VLM)作为语义规划器来解决这个问题。该VLM预测文本驱动和空间感知的语义远见,这有助于识别正确的对象并理解场景几何以进行精确操作。然后,这种远见被用来指导WAM,确保生成的内容和预测的动作紧密遵循给定的指令。在模拟和真实环境中的实验表明,SG-WAM显著提高了操作精度和指令遵循能力。 AI
影响 通过改进语言基础来提高指令遵循能力,从而增强机器人操作。
排序理由 该集群包含一篇详细介绍机器人新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →