PulseAugur
实时 10:05:19
English(EN) RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

新的RoadBench基准测试揭示多模态大语言模型在城市空间推理方面存在困难

一个名为RoadBench的新基准测试已被开发出来,用于评估多模态大语言模型(MLLMs)在复杂城市道路场景下细粒度的空间理解和推理能力。该基准测试侧重于道路标记,包含八项任务和超过3000个测试用例,使用了来自五个中国城市的鸟瞰图和第一人称视角图像。对20个主流MLLMs的初步评估显示存在显著的不足,一些模型的表现甚至不如简单的基线模型,表明该领域需要改进。 AI

影响 突出了MLLM空间推理能力的关键差距,可能指导未来自动驾驶系统和城市规划模型的开发。

排序理由 该集群包含一篇介绍用于评估AI模型的新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的RoadBench基准测试揭示多模态大语言模型在城市空间推理方面存在困难

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li ·

    RoadBench:在城市道路场景下对细粒度空间理解与推理进行多模态大模型基准测试

    arXiv:2511.18011v2 Announce Type: replace Abstract: Multimodal large language models (MLLMs) have demonstrated powerful capabilities in general spatial understanding and reasoning. However, their fine-grained spatial understanding and reasoning capabilities in complex urban scena…