arXiv上发表的一项新研究强调,在使用视觉-语言模型从街景图像测量城市变迁时存在显著的可靠性问题。研究人员发现,重新拍摄同一条街道会将感知分数平均改变0.80分,这一变化与两条不同街道之间的差异相当。虽然重复调用模型对这种变化的贡献很小,但图像重新编码和提示顺序等因素对分数有显著影响。即使是微小的物理变化或采集条件的变化,也会导致模型在相同的场景中报告物理变化,尽管聚合数百次观测可以恢复连贯的再开发信号。 AI
影响 强调了在城市监测等实际应用中,视觉-语言模型需要提高鲁棒性和验证性。
排序理由 学术论文,详细说明了AI模型在特定任务中的局限性。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →