PulseAugur
实时 16:11:28
English(EN) Run forty experiments against one eval set and you will find an improvement that is not there

LLM评估偏差:赢家诅咒夸大了性能指标

在LLM评估中,一种常见的做法是针对固定数据集测试多个提示变体,并选择表现最佳的一个,这可能导致性能指标虚高。这是由于“赢家诅咒”,即嘈杂测量值的最大值本身就存在向上偏差。例如,在一个包含250个样本的数据集上测试四十个提示变体,即使没有取得实际进展,也可能产生约五分的表观改进。研究人员建议采用分离开发集和确认集、根据实验次数调整性能阈值、仔细记录数据集查询次数以及定期刷新评估集等做法来缓解这种偏差。 AI

影响 强调了LLM评估中的一个关键缺陷,该缺陷可能导致误导性的性能声明,并敦促采用更严格的测试方法。

排序理由 该条目讨论了LLM评估方法中的一个统计问题,并引用了关于自适应数据分析的学术工作。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LLM评估偏差:赢家诅咒夸大了性能指标

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Maya Andersson ·

    运行四十次实验针对一个评估集,你就会发现一个不存在的改进

    <p>You iterate on a prompt, run the eval set, keep the best variant. Repeat for a quarter. The number that survives is the maximum of forty noisy measurements, and the maximum of noisy measurements is an upward-biased estimate of the thing you care about. The size of that bias is…