研究人员开发了 ClinMM-Bench,这是一个旨在评估大型语言模型 (LLM) 在复杂临床场景中进行多轮多模态诊断推理能力的新基准。该基准包含 1,089 个真实临床病例和 3,760 张医学影像,涵盖八个专科。对 15 个代表性 LLM 的初步评估显示,尽管专有模型表现出更高的诊断准确性,但没有一个模型能做出完美诊断,所有模型在生成可靠的诊断推理方面都存在局限性,常见的失败模式包括信息综合问题和视觉幻觉。 AI
影响 该基准通过突出特定的推理失败,有望推动 LLM 在医疗应用中的改进。
排序理由 该集群包含一篇介绍用于评估 AI 模型的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →