PulseAugur
实时 08:56:51
实体 robot task success

robot task success

PulseAugur coverage of robot task success — every cluster mentioning robot task success across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_235443 ·

    新的FailBench基准揭示了视觉语言模型在机器人任务成功评估方面的不可靠性

    一个名为FailBench的新基准已被开发出来,用于评估视觉语言模型(VLMs)在判断机器人任务成功方面的可靠性。该基准包含2,197次操作尝试,结果显示,即使是表现最好的VLM,在检测机器人故障方面的平衡准确率也仅为0.77。针对故障检测进行微调的模型表现不如通用VLMs,并且在需要精细视觉证据的任务(如组装)上,它们的性能显著下降。研究人员发现,在模糊情况下存在预测成功的偏见,尽管空间定位等输入级干预显示出改进的潜力。