研究人员推出了 PriVE-Bench,这是一个旨在评估视觉语言模型(VLM)在多大程度上将其答案建立在视觉证据之上,而不是依赖于学习到的语言或类别先验的新基准。该基准使用成对的原始图像和逆事实图像来测试模型是否能够区分视觉现实与常识。此外,PriVE-Tools 通过评估使用边界框和裁剪等工具的代理视觉系统是否能改善针对这些逆事实冲突的接地情况来扩展这一点。初步结果表明,虽然视觉证据工具可以帮助一些模型,但它们并不能普遍阻止对先验的依赖。 AI
影响 这项研究可能带来更强大的视觉语言模型,这些模型不易受偏见影响,并且更多地依赖于实际的视觉输入。
排序理由 该集群描述了一个用于评估 AI 模型的新基准和工具,该基准和工具在一篇学术论文中提出。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- PriVE-Bench
- PriVE-Tools
- ScienceCast
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →