研究人员推出了CliniCARE-Bench,这是一个旨在评估大型语言模型在处理电子健康记录(EHR)时临床推理能力的新基准。该基准使用源自MIMIC-IV数据的750个患者病例,不仅评估判决准确性,还评估结论的证据基础、政策遵循情况以及校准性弃权。对16个代理系统的初步评估显示,虽然原始准确率得分相对较高,但无缺陷准确率(对禁止的捷径进行惩罚)显著较低,从而重新排序了性能排行榜。 AI
影响 该基准有望推动更可靠、更值得信赖的临床决策支持AI系统的发展。
排序理由 该集群描述了一个用于评估特定领域AI模型的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →