PulseAugur
实时 08:40:15
English(EN) Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

新的MissionBench基准揭示多模态大语言模型在航空具身任务方面存在困难

研究人员推出了MissionBench,这是一个旨在评估多模态大语言模型(MLLMs)在航空三维环境中的零样本、任务级能力的新基准。该基准包含跨越五个模拟环境和四个任务家族的120个任务,要求代理仅使用以自身为中心的观察和动作历史来自主规划、导航和报告结果。对22个开源和闭源MLLMs进行的初步测试显示,即使是表现最好的模型,成功率也低于35%,远低于人类84.4%的成功率,这表明多步具身任务的难度很大。研究还观察到,更大规模的通用模型在零样本具身能力方面有所提高,这表明扩展模型可以提高在这些复杂的航空场景中的性能。 AI

影响 凸显了当前MLLMs在复杂、多步具身任务方面的显著差距,为未来航空AI代理的研究指明方向。

排序理由 该集群描述了一个评估MLLMs的新基准和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MissionBench基准揭示多模态大语言模型在航空具身任务方面存在困难

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano ·

    Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

    arXiv:2607.22014v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) are emerging as core reasoning modules for embodied agents, yet it remains unclear how well general-purpose models can solve long-horizon embodied tasks from a single high-level instruction…