研究人员推出了GeoContext,一个旨在评估视觉语言模型在地理定位任务中表现的新基准。该基准解决了两种失败模式:过度依赖用户提供的地理位置上下文以及错误确认地理位置声明的倾向。GeoContext包含开放式本地化(带有粗略地理位置提示)和150米半径内声明的二元验证任务。对五个模型的初步评估显示,在本地化准确性和验证方面存在显著问题,模型经常高估其对错误声明的置信度。 AI
影响 凸显了当前视觉语言模型在现实世界地理定位方面的局限性,可能指导未来在更鲁棒的空间推理方面的研究。
排序理由 该集群包含一篇介绍新AI模型评估基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- DagsHub
- GeoContext
- Gotit.pub
- Hugging Face
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →