PulseAugur
实时 20:34:59
English(EN) GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

新的GST-Bench基准揭示VLM在视频中全局空间意识方面存在困难

研究人员推出了GST-Bench,这是一个新的基准,旨在利用视频数据评估视觉语言模型(VLMs)的全局空间意识。该基准包含源自超过6790分钟合成视频的问题,要求模型从新的视角推断空间关系,并将以自我为中心的观察映射到全局俯视视角。对22个最先进VLM的评估显示,与人类相比存在显著的性能差距,表现最好的模型准确率仅为42.68%,远低于人类的79.08%。进一步分析表明,虽然模型具有很强的局部空间理解能力,但它们难以将长时程的观察结果整合为一致的全局场景表示。 AI

影响 突出了VLM能力中的一个关键差距,可能指导未来研究朝着改进的空间推理和场景表示方向发展。

排序理由 该集群描述了一个用于评估AI模型的新学术基准和相关数据集。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的GST-Bench基准揭示VLM在视频中全局空间意识方面存在困难

报道来源 [2]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    GST-Bench:多模态大模型能否从视频中发展出全局空间感知能力?

    Spatial intelligence is fundamental to embodied agents, yet existing benchmarks focus on local spatial perception from single or few viewpoints, overlooking global spatial awareness over continuous, long-horizon visual streams. To address this limitation, we introduce the Global-…

  2. arXiv cs.CV TIER_1 English(EN) · Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li ·

    GST-Bench:多模态大模型能否从视频中发展出全局空间感知能力?

    arXiv:2608.05747v1 Announce Type: new Abstract: Spatial intelligence is fundamental to embodied agents, yet existing benchmarks focus on local spatial perception from single or few viewpoints, overlooking global spatial awareness over continuous, long-horizon visual streams. To a…