一篇新的研究论文强调了放射科医生报告实践的差异如何显著影响基于AI的放射学报告生成(RRG)模型的评估。该研究引入了一种称为ReRef的方法来重写参考报告,证明术语、格式或细节的变化会改变模型排名。例如,在参考报告中精简正常发现导致一个模型性能下降,而另一个模型性能上升,这表明当前的指标可能无法充分区分临床解释和报告风格。研究人员发布了一个新的数据集MIMIC-CXR-Ext-ReRef,以帮助该领域的未来研究。 AI
影响 强调了当前放射学AI评估指标的潜在缺陷,表明需要更稳健的方法来区分临床解释和报告风格。
排序理由 研究论文,详细介绍了评估AI模型的新方法和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →