两篇新研究论文探讨了用于临床应用的人工智能模型中不确定性估计的关键问题。第一篇论文介绍了一种用于临床文本分类的大型语言模型(LLM)的新型贝叶斯方法,将LLM视为模拟器,以生成关于诊断的后验分布。该方法旨在提供比传统黑盒方法更可靠的不确定性量化,在区分临床基准上的正确预测与错误方面表现优越。第二篇论文侧重于用于临床预测的视觉语言模型,强调了仔细选择用于评估不确定性估计的“正确性标准”的重要性。它提出了一个基于人类一致性和对下游性能的保真度来评估这些标准的框架,发现标准方法可能会扭曲结果,甚至颠倒不同不确定性估计技术的排名。 AI
影响 不确定性估计的进步对于人工智能在医疗保健领域安全可靠的部署至关重要,有望提高诊断准确性和患者预后。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了临床AI应用中不确定性估计的新方法。
- arXiv
- Hugging Face
- Large Language Models
- Mridul Sharma
- MultiCare Tacoma General Hospital
- OLB-300
- Uncertainty estimation
- Vision-language models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →