一个名为RoadBench的新基准测试已被开发出来,用于评估多模态大语言模型(MLLMs)在复杂城市道路场景下细粒度的空间理解和推理能力。该基准测试侧重于道路标记,包含八项任务和超过3000个测试用例,使用了来自五个中国城市的鸟瞰图和第一人称视角图像。对20个主流MLLMs的初步评估显示存在显著的不足,一些模型的表现甚至不如简单的基线模型,表明该领域需要改进。 AI
影响 突出了MLLM空间推理能力的关键差距,可能指导未来自动驾驶系统和城市规划模型的开发。
排序理由 该集群包含一篇介绍用于评估AI模型的新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →