研究人员开发了新的基准来评估用于机器人操作的视频世界模型的可信度。这些基准使用真实的DROID片段,在正常、约束敏感、反事实和对抗性场景下评估模型。初步评估显示,尽管当前模型可以生成视觉上连贯的视频,但它们在推理约束、物理交互和抑制不安全指令方面存在困难,这表明仅凭视觉质量不足以满足可靠的机器人应用。 AI
影响 这些基准突显了当前视频世界模型的关键差距,推动了现实世界机器人应用在推理和安全性方面的进步。
排序理由 多篇研究论文介绍了用于评估机器人操作中视频世界模型的新基准和模型。
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →