PulseAugur
实时 04:03:44
English(EN) VLMs can score well on benchmarks, while silently erasing meaningful terms and including hallucinate bias [P]

新论文揭示了 VLM 对放射学报告的评估指标存在缺陷

一篇新论文强调了当前视觉语言模型(VLM)评估指标在放射学报告生成领域存在的重大缺陷。研究人员观察到,这些指标常常奖励重复或泛泛的报告,却忽略了临床上有意义术语的删除以及偏见语言的引入。该研究提出了一个新的框架,专门用于衡量 VLM 生成报告中术语的遗漏和偏见语言的包含,旨在更准确地评估其临床效用。 AI

影响 强调了改进 VLM 评估方法的必要性,这可能会影响其在医疗报告生成等关键应用中的可靠性。

排序理由 该集群包含一篇研究论文,讨论了特定类型 AI 模型评估指标的局限性。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/MachineLearning 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新论文揭示了 VLM 对放射学报告的评估指标存在缺陷

报道来源 [1]

  1. r/MachineLearning TIER_1 English(EN) · /u/ade17_in ·

    VLMs可以在基准测试中取得好成绩,同时悄悄抹去有意义的术语并包含幻觉偏差[P]

    <!-- SC_OFF --><div class="md"><p>While working with VLMs for report generation on chest x-rays (RRG), we noticed that evaluation metrics are flawed.</p> <p>Flawed in a sense where they rewarded repetitive templates, reports without clinical terms and reports which were &quot;nor…