PulseAugur
实时 10:53:17
English(EN) When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide

新研究质疑对 Top-k 分配的离线评估的信任度

一篇新的研究论文探讨了在预算有限的情况下,对 Top-k 分配策略的离线评估的信任度所面临的挑战。该研究在五个数据集上对六种不同的估计方法进行了基准测试,结果显示数据中的弱重叠是一个关键因素,它受记录器-目标行为一致性的影响,而不仅仅是记录的清晰度。研究还强调,交叉拟合结果并不能解决优化器的诅咒问题,并且倾向估计误差是这些评估中性能下降的重要来源。 AI

影响 这项研究为在机器学习中使用离线评估方法的实践者提供了关键见解,特别是在资源受限的分配策略方面。

排序理由 该项目是一篇发表在 arXiv 上的研究论文,讨论了一种特定的机器学习评估方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究质疑对 Top-k 分配的离线评估的信任度

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Binshuang Li ·

    何时可以信任等成本 Top-k 分配的离线评估?一个受控、可复现的基准和实践者指南

    arXiv:2608.12489v1 Announce Type: cross Abstract: Organizations decide whom to treat under a budget and want to know what a targeting rule would have earned before deploying it. Off-policy evaluation promises this from logged data, but the deployable rule is a deterministic top-k…