一篇新的研究论文探讨了视觉语言模型(VLM)在医学视觉问答(VQA)中的过度自信和校准问题。研究发现,不同模型家族、规模和提示策略都存在过度自信现象,并且像Platt scaling这样的事后校准方法可以改善校准但不能提高判别质量。该研究还引入了幻觉感知校准(HAC),它利用幻觉检测信号来优化置信度估计,从而在校准和AUROC方面都得到改善,尤其是在开放式问题上。 AI
影响 强调了改进医学AI置信度校准的必要性,可能带来更可靠的临床决策支持。
排序理由 学术论文,详细介绍了实证发现并提出了一种新的缓解方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →