研究人员推出 ObGynLongBench,这是一个旨在评估大型语言模型 (LLM) 在使用纵向电子病历 (EHR) 进行临床决策时性能的新基准。该基准包含 1,500 个源自真实妊娠 EHR 病史的病例,揭示了在直接提供证据与必须从患者记录中提取证据时,LLM 性能之间存在显著差距。研究发现,随着 EHR 上下文的延长和证据要求的复杂性增加,模型的准确性会下降,而在 EHR 访问策略中,主动搜索代理表现最佳。 AI
影响 凸显了大型语言模型在处理复杂患者数据的真实世界临床决策中面临的挑战,表明需要改进证据提取能力。
排序理由 该集群描述了在 arXiv 上发布的新基准和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →