一个名为FailBench的新基准已被开发出来,用于评估视觉语言模型(VLMs)在判断机器人任务成功方面的可靠性。该基准包含2,197次操作尝试,结果显示,即使是表现最好的VLM,在检测机器人故障方面的平衡准确率也仅为0.77。针对故障检测进行微调的模型表现不如通用VLMs,并且在需要精细视觉证据的任务(如组装)上,它们的性能显著下降。研究人员发现,在模糊情况下存在预测成功的偏见,尽管空间定位等输入级干预显示出改进的潜力。 AI
影响 突出了当前VLMs在关键机器人应用中的局限性,表明需要提高鲁棒性和进行专门的故障检测训练。
排序理由 该集群包含一篇介绍新基准和评估结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- FailBench
- Hrant Davtyan
- robot failure detection
- robot manipulation
- robot task success
- vision-language model
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →