PulseAugur
实时 10:13:57
English(EN) Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

新的UAV-DualCog基准揭示了MLLMs在航空推理方面的局限性

研究人员推出UAV-DualCog,这是一个旨在评估多模态大语言模型(MLLMs)在无人机(UAV)场景下双认知能力的新基准。该基准评估了MLLMs在复杂时空背景下推理无人机自身状态及其外部环境的能力。目前的MLLMs在自我状态推理、精确空间定位和时间定位方面表现出显著的局限性,表明现有模型与可靠UAV代理的要求之间存在巨大差距。该基准还包括一个训练数据集UAV-DualCog-Train,可作为推进基于MLLM的UAV系统的宝贵资源。 AI

影响 突出了MLLMs在现实世界航空应用中的关键能力差距,为未来UAV代理的自我状态和环境推理研究指明方向。

排序理由 该条目描述了一个用于评估特定领域(UAVs)中MLLMs的新基准和数据集,发布在arXiv论文中。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的UAV-DualCog基准揭示了MLLMs在航空推理方面的局限性

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao ·

    认识自我,理解世界:面向无人机时空推理的多模态大语言模型双认知基准

    arXiv:2607.16193v1 Announce Type: new Abstract: Multimodal large language models have achieved strong performance across diverse vision-language tasks, yet their capabilities in UAV scenarios remain insufficiently explored. Recent UAV-oriented benchmarks have begun to evaluate ML…