发布了两个新的基准测试Med-R2和MedVIGIL,用于评估医疗视觉语言模型(VLMs)的可信度和证据基础推理能力。Med-R2关注临床工作流程不同阶段的对抗鲁棒性,揭示了当前模型常常依赖于虚假先验而非视觉证据。MedVIGIL专门测试VLM识别视觉证据是否失效或具有误导性的能力,这是安全临床部署的关键因素。两个基准测试都突显了当前医疗VLM的显著局限性,并旨在推动其可靠性和临床适用性的改进。 AI
影响 这些基准测试将通过暴露当前模型在基于证据的推理和处理失效视觉信息方面的弱点,推动更可靠、更值得信赖的医疗AI的发展。
排序理由 该集群包含两篇介绍用于评估AI模型基准测试的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →