研究人员推出了MedLoCoMo,这是一个旨在评估大型语言模型长上下文医疗对话能力的新基准。该基准源自MIMIC-IV和MIMIC-IV-Note记录,侧重于跨多个就诊的患者特定临床推理。MedLoCoMo包含100个患者时间线,平均超过74,000个token,测试模型在单次就诊、跨就诊以及对抗性无法回答问题方面的能力。初步评估表明,即使是那些具有广泛上下文窗口或检索机制的模型,跨就诊推理仍然是一个重大挑战。 AI
影响 该基准将有助于研究人员评估和提高LLM在处理复杂的、纵向的患者数据以进行临床推理方面的能力。
排序理由 该集群描述了一个用于在特定领域评估LLM的新基准,该基准在一篇学术论文中发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →