PulseAugur
实时 10:32:37
English(EN) MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models

新的MedLoCoMo基准测试LLM在长上下文医疗对话方面的能力

研究人员推出了MedLoCoMo,这是一个旨在评估大型语言模型长上下文医疗对话能力的新基准。该基准源自MIMIC-IV和MIMIC-IV-Note记录,侧重于跨多个就诊的患者特定临床推理。MedLoCoMo包含100个患者时间线,平均超过74,000个token,测试模型在单次就诊、跨就诊以及对抗性无法回答问题方面的能力。初步评估表明,即使是那些具有广泛上下文窗口或检索机制的模型,跨就诊推理仍然是一个重大挑战。 AI

影响 该基准将有助于研究人员评估和提高LLM在处理复杂的、纵向的患者数据以进行临床推理方面的能力。

排序理由 该集群描述了一个用于在特定领域评估LLM的新基准,该基准在一篇学术论文中发布。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MedLoCoMo基准测试LLM在长上下文医疗对话方面的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zeyu Zhang, Ziqing Wang, Kaize Ding ·

    MedLoCoMo:面向大型语言模型的长上下文多会话医疗对话基准

    arXiv:2607.22566v1 Announce Type: new Abstract: MedLoCoMo is a Medical Long-Context Memory benchmark for patient-specific clinical reasoning over multi-admission medical dialogue. Existing medical QA benchmarks largely test short context knowledge or single document grounding, le…