研究人员推出UAV-DualCog,这是一个旨在评估多模态大语言模型(MLLMs)在无人机(UAV)场景下双认知能力的新基准。该基准评估了MLLMs在复杂时空背景下推理无人机自身状态及其外部环境的能力。目前的MLLMs在自我状态推理、精确空间定位和时间定位方面表现出显著的局限性,表明现有模型与可靠UAV代理的要求之间存在巨大差距。该基准还包括一个训练数据集UAV-DualCog-Train,可作为推进基于MLLM的UAV系统的宝贵资源。 AI
影响 突出了MLLMs在现实世界航空应用中的关键能力差距,为未来UAV代理的自我状态和环境推理研究指明方向。
排序理由 该条目描述了一个用于评估特定领域(UAVs)中MLLMs的新基准和数据集,发布在arXiv论文中。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- MLLMs
- ScienceCast
- UAV-DualCog
- unmanned aerial vehicle
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →