研究人员开发了 EarlyDx,这是一个旨在评估 AI 模型在仅有有限的入院时临床数据的情况下生成诊断能力的基准测试。与之前的基准测试不同,EarlyDx 使用自由文本记录,并根据急诊就诊而非完整的住院过程来监督诊断。LLM 审计员会验证支持每项诊断的证据,评估仅关注完全支持的标签。包括专门的医疗模型和通用的前沿模型在内的当前模型,在从入院时证据中可靠推断诊断方面存在困难,零样本模型表现不佳,即使是经过后训练的系统在推断召回率方面也存在显著差距。 AI
影响 该基准测试突显了 AI 在实时临床决策中面临的挑战,表明需要改进医疗 AI 的推理能力。
排序理由 该集群描述了一个在专业领域(医学诊断)中用于 AI 的新学术基准测试,发布在 arXiv 上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →