一项新研究评估了几种大型语言模型(LLMs)在使用光学图像对结直肠息肉进行分类时的诊断准确性。该研究使用了PRIME数据集,并将Claude Opus 4、Google Gemini 2.5 Pro、GPT-o3、GPT-4o和GPT-5等模型与专家响应进行了比较。虽然大多数模型在广泛的息肉分类中取得了较高的F1分数,但Gemini 2.5 Pro和Claude Opus 4在区分特定息肉亚型方面表现出最高的准确性,尽管总体敏感性和特异性未达到临床标准。 AI
影响 大型语言模型在医学图像分析方面展现出潜力,但临床部署仍需进一步发展。
排序理由 该集群是一篇研究论文,详细介绍了大型语言模型在特定诊断任务上的性能。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude Opus 4
- Google Gemini 2.5 Pro
- GPT-4o
- GPT-5
- GPT-o3
- Narrow-band Imaging Colorectal Endoscopic (NICE)
- Paris classification
- PRIME dataset
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →