研究人员推出了GST-Bench,这是一个新的基准,旨在利用视频数据评估视觉语言模型(VLMs)的全局空间意识。该基准包含源自超过6790分钟合成视频的问题,要求模型从新的视角推断空间关系,并将以自我为中心的观察映射到全局俯视视角。对22个最先进VLM的评估显示,与人类相比存在显著的性能差距,表现最好的模型准确率仅为42.68%,远低于人类的79.08%。进一步分析表明,虽然模型具有很强的局部空间理解能力,但它们难以将长时程的观察结果整合为一致的全局场景表示。 AI
影响 突出了VLM能力中的一个关键差距,可能指导未来研究朝着改进的空间推理和场景表示方向发展。
排序理由 该集群描述了一个用于评估AI模型的新学术基准和相关数据集。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →