PulseAugur
实时 09:13:36
English(EN) CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

新基准评估LLM在电子病历数据上的临床推理能力

研究人员推出了CliniCARE-Bench,这是一个旨在评估大型语言模型在处理电子健康记录(EHR)时临床推理能力的新基准。该基准使用源自MIMIC-IV数据的750个患者病例,不仅评估判决准确性,还评估结论的证据基础、政策遵循情况以及校准性弃权。对16个代理系统的初步评估显示,虽然原始准确率得分相对较高,但无缺陷准确率(对禁止的捷径进行惩罚)显著较低,从而重新排序了性能排行榜。 AI

影响 该基准有望推动更可靠、更值得信赖的临床决策支持AI系统的发展。

排序理由 该集群描述了一个用于评估特定领域AI模型的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准评估LLM在电子病历数据上的临床推理能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, … ·

    CliniCARE-Bench:电子病历中临床校准的医学推理审计

    arXiv:2608.07796v1 Announce Type: new Abstract: Large language models perform strongly on medical knowledge benchmarks, but reliable clinical deployment requires agents to conduct defensible investigations over heterogeneous, longitudinal records: determining what evidence is nee…