一篇新的研究论文介绍 Mind2Web-Injection,这是一个旨在评估视觉语言模型 (VLM) 在做决策时如何利用视觉证据的基准,特别是在网络代理防护栏的背景下。该基准包含超过 9,000 个指令-截图对,并附有详细的证据定位和反事实示例。研究发现,在测试的 VLM 中,证据对齐检测存在显著差异,一些模型未能将其判决与提供的视觉信息正确关联。 AI
影响 引入了一种新的评估方法,以更好地理解 VLM 的决策过程并识别防护栏中的潜在弱点。
排序理由 介绍用于评估视觉语言模型的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →