研究人员推出了一款名为SleepWalk的新基准,旨在严格测试AI模型在指令引导下的视觉语言导航能力。该基准专注于3D环境中的局部、以交互为中心的具身推理,评估模型在遵循自然语言指令的同时,预测与场景几何形状一致且避免碰撞的轨迹的能力。SleepWalk将任务分为三个难度级别,以便详细分析模型如何处理日益增长的空间和时间复杂性,揭示了在具身空间推理方面存在的显著缺陷,尤其是在多步指令和遮挡情况下。 AI
影响 该基准将有助于推动具身多模态推理以及3D环境中具备行动能力代理的发展。
排序理由 该集群描述了一篇用于评估AI模型的新学术基准论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →