一篇新研究论文提出了面向上下文老虎机的跨域策略离轨评估与学习(OPE/L),解决了现有方法的局限性。所提出的方法允许使用来自目标域和其他相关域的历史数据来评估和学习新策略。这种新颖的表述旨在提高在数据有限、确定性日志策略以及引入新动作等具有挑战性场景下的OPE/L性能,这些场景在个性化医疗和内容推荐等领域很常见。 AI
影响 这项研究通过在数据有限或复杂的领域中实现更好的策略评估和学习,有可能提高个性化系统的有效性。
排序理由 该条目是一篇提交到arXiv的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Contextual Bandits
- CORE Recommender
- Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits
- Cross-Domain OPE/L
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- Off-Policy Evaluation and Learning for External Validity under a Covariate Shift
- OPE/L
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →