研究人员推出了社交导航场景理解基准(SocialNav-SUB),这是一个新的数据集和评估框架,旨在测试视觉语言模型(VLMs)在理解机器人复杂社交导航场景方面的能力。该基准在最近的一篇arXiv论文中提出,包含视觉问答任务,评估VLMs在空间、时空和社会动力学方面对代理进行推理的能力。初步实验表明,即使是最先进的VLMs,其表现也逊于更简单的基于规则的方法和人类共识,这凸显了它们在人类机器人交互应用中的社交场景理解方面存在显著差距。 AI
影响 强调了当前VLMs在现实世界社交机器人导航方面的局限性,表明需要改进社交场景理解。
排序理由 学术论文,介绍了一个新的基准数据集和评估框架,用于视觉语言模型。 [lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Michael Munje
- SocialNav-SUB
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →