研究人员开发了一种新颖的实验协议,通过策略重叠降低方差来加速 A/B 测试。该方法利用 $\Delta$-Off-Policy Estimation 来获得平均处理效应的无偏估计,在策略具有共同支持时优于标准的均值差估计量。该方法有望对推荐系统、信息检索管道和大型语言模型界面的评估产生重大影响。 AI
影响 这种新方法可以显著提高在实际应用中评估 AI 模型和界面的效率。
排序理由 该集群包含一篇在 arXiv 上发表的研究论文,详细介绍了一种新的 A/B 测试方法。
- A/B testing
- alphaXiv
- arXiv
- arXivLabs
- CatalyzeX
- CORE Recommender
- Counterfactual Estimation
- DagsHub
- Difference-in-Means
- Gotit.pub
- Hugging Face
- IArxiv
- large language model
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →