PulseAugur
实时 09:13:14
实体 MissionBench

MissionBench

PulseAugur coverage of MissionBench — every cluster mentioning MissionBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_165042 ·

    新的MissionBench基准揭示多模态大语言模型在航空具身任务方面存在困难

    研究人员推出了MissionBench,这是一个旨在评估多模态大语言模型(MLLMs)在航空三维环境中的零样本、任务级能力的新基准。该基准包含跨越五个模拟环境和四个任务家族的120个任务,要求代理仅使用以自身为中心的观察和动作历史来自主规划、导航和报告结果。对22个开源和闭源MLLMs进行的初步测试显示,即使是表现最好的模型,成功率也低于35%,远低于人类84.4%的成功率,这表明多步具身任务的难度很大。研究还观察到,更大规模的通用模…