研究人员推出了 MedReaMM,这是一个旨在评估大型多模态模型(LMM)在临床环境中诊断综合能力的新基准。与之前侧重于孤立文本或视觉任务的基准不同,MedReaMM 整合了患者病史和多张医学影像,以评估鉴别诊断的准确性。该基准包含 625 个专家验证的病例,结果显示,在接受评估的 23 个 LMM 中,大多数的诊断准确率低于 50%,这凸显了它们在执行专家级临床推理能力方面存在的显著差距。 AI
影响 强调了当前大型多模态模型在复杂医学诊断能力方面存在的关键差距,表明需要改进多模态推理和整合能力。
排序理由 该集群描述了一篇介绍用于评估 AI 模型基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- clinical diagnostic synthesis
- Hugging Face
- ICD-11
- large-language models
- Large Multimodal Models
- LMMs
- MedReaMM
- visual question answering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →