PulseAugur
实时 10:23:14
English(EN) AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

新的AeroGround基准揭示了视觉语言模型(VLM)在空地推理方面存在显著差距

研究人员推出了AeroGround,这是一个旨在评估视觉语言模型(VLM)在空地协同推理任务中的新基准。该基准包含一个模拟数据集,约有29,000个多模态观测组和2,250个问答实例,侧重于跨视图对应、空间理解和推理。目前的VLM与人类相比表现出显著的性能差距,最佳模型的准确率仅为54.4%,凸显了对更强大的空地协同具身智能系统的需求。 AI

影响 突显了当前VLM在现实世界空地协作方面的能力差距,推动了未来的研究。

排序理由 该集群描述了在arXiv上发布的一个新的研究基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AeroGround基准揭示了视觉语言模型(VLM)在空地推理方面存在显著差距

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Shenghong Yi, Lin Zhang, Muzian Li, Jiakang Yuan, Haoyu Zhang, Peng Ye, Jiayuan Fan, Huafeng Qin, Tao Chen ·

    AeroGround:航空-地面协同推理综合基准

    arXiv:2608.14721v1 Announce Type: new Abstract: Vision-language models (VLMs) have been widely employed in understanding and reasoning tasks for unmanned aerial vehicles (UAVs). Existing UAV benchmarks primarily focus on aerial-view scenarios. However, whether current VLMs can pe…