研究人员推出了 PathoArgus-Bench,这是一个旨在评估全切片病理学视觉推理的新基准。该基准专门测试模型在大型千兆像素图像中将预测与视觉证据联系起来的能力,超越了简单的答案准确性。使用 PathoArgus-Bench 进行的初步评估显示,即使是 GPT-5.6 等先进模型在证据基础方面也存在困难,在需要跨不同证据状态进行一致预测的任务上得分较低。 AI
影响 该基准突显了当前 AI 模型在将视觉推理与证据联系起来方面的关键局限性,可能指导未来开发更可靠的诊断工具。
排序理由 该集群包含一篇研究论文,介绍了计算病理学中 AI 的新基准和评估协议。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →