PulseAugur
实时 07:01:34
实体 ClinMM-Bench

ClinMM-Bench

PulseAugur coverage of ClinMM-Bench — every cluster mentioning ClinMM-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_169740 ·

    New benchmark ClinMM-Bench evaluates LLMs on complex clinical diagnostic reasoning

    研究人员开发了 ClinMM-Bench,这是一个旨在评估大型语言模型 (LLM) 在复杂临床场景中进行多轮多模态诊断推理能力的新基准。该基准包含 1,089 个真实临床病例和 3,760 张医学影像,涵盖八个专科。对 15 个代表性 LLM 的初步评估显示,尽管专有模型表现出更高的诊断准确性,但没有一个模型能做出完美诊断,所有模型在生成可靠的诊断推理方面都存在局限性,常见的失败模式包括信息综合问题和视觉幻觉。