PulseAugur
实时 12:53:08
English(EN) MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

新的基准测试探究医疗AI的推理和可信度

发布了两个新的基准测试Med-R2和MedVIGIL,用于评估医疗视觉语言模型(VLMs)的可信度和证据基础推理能力。Med-R2关注临床工作流程不同阶段的对抗鲁棒性,揭示了当前模型常常依赖于虚假先验而非视觉证据。MedVIGIL专门测试VLM识别视觉证据是否失效或具有误导性的能力,这是安全临床部署的关键因素。两个基准测试都突显了当前医疗VLM的显著局限性,并旨在推动其可靠性和临床适用性的改进。 AI

影响 这些基准测试将通过暴露当前模型在基于证据的推理和处理失效视觉信息方面的弱点,推动更可靠、更值得信赖的医疗AI的发展。

排序理由 该集群包含两篇介绍用于评估AI模型基准测试的学术论文。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的基准测试探究医疗AI的推理和可信度

报道来源 [2]

  1. arXiv cs.CV TIER_1 English(EN) · Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu, Zuozhu Liu ·

    Med-R2:医学视觉语言模型中基于证据的推理的对抗性基准

    arXiv:2605.24492v1 Announce Type: new Abstract: Vision-language models have demonstrated impressive capabilities in general medical visual question answering, yet due to limited interpretability, it remains unclear whether their predictions reflect evidence-grounded clinical reas…

  2. arXiv cs.CV TIER_1 English(EN) · Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li ·

    MedVIGIL:评估在损坏视觉证据下的可信医疗视觉语言模型

    arXiv:2605.07919v2 Announce Type: replace Abstract: Medical vision--language models (VLMs) are usually evaluated on intact image--question pairs, but trustworthy clinical use requires a stronger property: a model must recognise when the evidential basis for an answer has failed. …