研究人员开发了一种新的方法来审计大语言模型(LLMs)在医疗诊断中的证据使用模式。这种方法超越了简单的准确性评估,将患者信息分解为证据单元,并根据受控证据子集对诊断进行评分。该研究在 DDXPlus、CupCase 和 MedCase 等数据集上评估了五个开源大语言模型,发现大多数证据交互是临床上合理的,而非诊断失败。审计发现,无效或捷径式案例通常涉及否定或缺失的发现,这凸显了在医疗大语言模型评估中进行角色感知审计的必要性。 AI
影响 这项新的审计技术可以通过确保医疗大语言模型基于适当的证据进行诊断来提高其可靠性和可信度。
排序理由 该集群包含一篇详细介绍新的人工智能模型评估方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →