新研究表明,视觉语言模型(VLM)在可供性预测方面存在困难,这主要是由于正确识别物体部件的困难,而不是缺乏动作知识。使用 GroundBench 等基准的研究表明,虽然命名目标部件能显著提高模型预测正确动作的能力,但一些模型可能依赖文本捷径而非真正的视觉接地。这表明改进部件识别是提高 VLM 在机器人操作任务中性能的关键。 AI
影响 强调了 VLM 可供性预测中的一个关键瓶颈,表明改进部件接地可以显著增强机器人操作能力。
排序理由 该集群包含两篇学术论文,详细介绍了新的基准和与视觉语言模型及其在可供性预测任务上的表现相关的发现。
- arXiv
- button
- Camera
- GPT-4o mini
- GPT-5
- GroundBench
- Hugging Face
- OpenAI
- Push
- robot
- vision-language model
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →