arXiv上发表的一项新研究发现,当前的医疗视觉语言模型(VLMs)在对胸部X射线进行预测时,未能提供忠实的视觉解释。研究人员评估了几种VLMs,包括MedGemma-4B变体、LLaVA-RAD和Qwen3-VL-8B-Instruct,以及CheXagent-2-3b等专业模型和传统分类器。研究结果表明,虽然一些VLMs使用了图像数据,但它们的注意力热图并未准确反映对其预测至关重要的图像区域,并且它们经常遗漏标注的解剖结构。这表明这些模型的视觉解释更多的是令人安心而非提供信息,凸显了对可靠的临床解释需要严格的定位指标和因果扰动方法。 AI
影响 强调了VLM在医疗应用中可解释性的关键局限性,需要新的评估标准。
排序理由 学术论文,详细介绍了VLM可解释性的新评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Binesh Kumar Sadanandan
- CheXagent-2-3b
- CheXlocalize
- DenseNet121
- LLaVA-RAD
- MedGemma 4B
- Qwen3-VL-8B-Instruct
- ResNet50
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →