研究人员发现,用于评估AI模型分布外(OOD)检测的基准数据集存在一个重大问题。他们发现,一些基准包含模型训练集中的数据,导致性能指标不准确。这种“泄露”使得模型在检测任务上表现良好,而实际上它们只是识别熟悉的数据。研究人员提出了一种新的诊断工具——“泄露指纹”,以识别此类污染,并提倡建立一个修正后的OOD基准构建协议。 AI
影响 凸显了AI评估方法中的关键缺陷,可能影响分布外检测研究的可靠性。
排序理由 详细介绍AI模型评估新诊断方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →