一项新的研究论文介绍TRUE-Colon,一个旨在揭示AI模型在精心策划的医学数据集上训练的性能与在真实临床环境中的性能之间差距的基准测试协议。研究发现,仅在以病灶为中心的基准上训练的模型,在完整结肠镜检查程序上进行评估时,准确性会显著下降。相反,在完整程序上训练的模型在精心策划的基准上保持了准确性,同时在真实场景中更好地排除了非息肉内容。该研究建议将完整程序数据用于训练和基准测试,以提高AI驱动的息肉检测系统的可部署性。 AI
影响 强调了医学AI中真实数据集的关键需求,以确保可靠的实际部署和患者安全。
排序理由 介绍新基准测试协议并评估AI模型的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →