PulseAugur
实时 09:16:29
English(EN) PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

新的PinpointQA基准测试MLLM在室内视频空间理解能力

研究人员推出PinpointQA,一个旨在评估多模态大语言模型(MLLM)在处理室内视频时的空间理解能力的新基准。该基准建立在ScanNet++和ScanNet200之上,包含超过10,000个问题-答案对,分为四个难度级别,侧重于精确的物体定位和空间描述。初步评估显示,当前MLLM在这些任务上的性能显著下降,尤其是在结构化空间预测方面,尽管监督微调显示出改进的潜力。 AI

影响 该基准有望推动AI在理解和交互真实室内环境方面的能力提升。

排序理由 该条目描述了一个用于评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的PinpointQA基准测试MLLM在室内视频空间理解能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng ·

    PinpointQA:室内视频中小物体中心空间理解的基准测试

    arXiv:2604.08991v3 Announce Type: replace-cross Abstract: Reliable embodied interaction in indoor environments requires agents to precisely localize small everyday objects from visual observations. Yet this fundamental capability remains challenging for multimodal large language …