研究人员推出了AeroGround,这是一个旨在评估视觉语言模型(VLM)在空地协同推理任务中的新基准。该基准包含一个模拟数据集,约有29,000个多模态观测组和2,250个问答实例,侧重于跨视图对应、空间理解和推理。目前的VLM与人类相比表现出显著的性能差距,最佳模型的准确率仅为54.4%,凸显了对更强大的空地协同具身智能系统的需求。 AI
影响 突显了当前VLM在现实世界空地协作方面的能力差距,推动了未来的研究。
排序理由 该集群描述了在arXiv上发布的一个新的研究基准。[lever_c_demoted from research: ic=1 ai=1.0]
- AeroGround
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- unmanned aerial vehicle
- vision-language model
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →