研究人员推出了MissionBench,这是一个旨在评估多模态大语言模型(MLLMs)在航空三维环境中的零样本、任务级能力的新基准。该基准包含跨越五个模拟环境和四个任务家族的120个任务,要求代理仅使用以自身为中心的观察和动作历史来自主规划、导航和报告结果。对22个开源和闭源MLLMs进行的初步测试显示,即使是表现最好的模型,成功率也低于35%,远低于人类84.4%的成功率,这表明多步具身任务的难度很大。研究还观察到,更大规模的通用模型在零样本具身能力方面有所提高,这表明扩展模型可以提高在这些复杂的航空场景中的性能。 AI
影响 凸显了当前MLLMs在复杂、多步具身任务方面的显著差距,为未来航空AI代理的研究指明方向。
排序理由 该集群描述了一个评估MLLMs的新基准和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →