研究人员推出SUP-MIMIC,一个旨在评估大型语言模型(LLMs)在临床诊断中鲁棒性的新基准。该框架基于MIMIC-IV-v3.1数据集构建,包含测试LLMs处理诊断模糊性以及从各种症状中识别常见疾病的能力的任务。初步评估表明,当前最先进的LLMs在这些任务上表现不佳,依赖统计捷径而非真正的因果推理,这可能导致在实际医疗应用中漏诊。 AI
影响 凸显了LLMs在临床环境中存在的关键安全问题,在推理能力提高之前可能会减缓其应用。
排序理由 该条目描述了一篇介绍用于评估LLMs的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →