PulseAugur
实时 10:13:29
实体 RoadBench

RoadBench

PulseAugur coverage of RoadBench — every cluster mentioning RoadBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_121610 ·

    新的RoadBench基准测试揭示多模态大语言模型在城市空间推理方面存在困难

    一个名为RoadBench的新基准测试已被开发出来,用于评估多模态大语言模型(MLLMs)在复杂城市道路场景下细粒度的空间理解和推理能力。该基准测试侧重于道路标记,包含八项任务和超过3000个测试用例,使用了来自五个中国城市的鸟瞰图和第一人称视角图像。对20个主流MLLMs的初步评估显示存在显著的不足,一些模型的表现甚至不如简单的基线模型,表明该领域需要改进。