研究人员推出了一种用于排序策略离线策略评估(OPE)的新方法——自适应双重稳健(ADR)。ADR旨在减少现有OPE技术(如逆倾向评分(IPS)、独立IPS(IIPS)和奖励交互IPS(RIPS))固有的方差和偏差。通过自适应地边际化重要性权重并结合奖励回归,通过控制变量校正,ADR在合成实验中证明了比以前的方法有更低的均方误差。 AI
影响 这项研究可能有助于更准确地评估推荐和排序系统,从而提高它们的性能和用户体验。
排序理由 该集群包含一篇详细介绍新的离线策略评估方法的论文。
- Adaptive Doubly Robust
- Adaptive Doubly Robust Off-Policy Evaluation for Ranking Policies under Diverse User Behavior
- Adaptive Inverse Propensity Scoring
- arXiv
- Hugging Face
- Independent IPS
- Inverse Propensity Scoring
- Reward Interaction IPS
- alphaXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- cs.IR
- cs.LG
- DagsHub
- Gotit.pub
- IArxiv Recommender
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →