研究人员开发了SABRE,一个新设计的自动化流程,用于为视觉语言模型(VLMs)创建压力测试。该框架将任务设计转换为结构化规范、图像和问答对,并进行自动化过滤以移除可解的候选。一项应用SABRE-Prior被用来测试六个VLMs对世界知识而非视觉证据的依赖性,显示平均准确率在17.8%到31.3%之间。SABRE旨在成为一个可重用的工具,用于构建和更新VLM压力测试。 AI
影响 为评估和改进视觉语言模型的鲁棒性提供了一种新方法。
排序理由 该集群包含一篇详细介绍AI模型基准测试新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →