PulseAugur
实时 08:42:49
English(EN) Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

新研究解决了上下文老虎机的跨域OPE/L问题

一篇新研究论文提出了面向上下文老虎机的跨域策略离轨评估与学习(OPE/L),解决了现有方法的局限性。所提出的方法允许使用来自目标域和其他相关域的历史数据来评估和学习新策略。这种新颖的表述旨在提高在数据有限、确定性日志策略以及引入新动作等具有挑战性场景下的OPE/L性能,这些场景在个性化医疗和内容推荐等领域很常见。 AI

影响 这项研究通过在数据有限或复杂的领域中实现更好的策略评估和学习,有可能提高个性化系统的有效性。

排序理由 该条目是一篇提交到arXiv的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究解决了上下文老虎机的跨域OPE/L问题

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yuta Natsubori, Masataka Ushiku, Yuta Saito ·

    Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

    arXiv:2607.22012v1 Announce Type: new Abstract: Off-Policy Evaluation and Learning (OPE/L) in contextual bandits is rapidly gaining popularity in real systems because new policies can be evaluated and learned securely using only historical logged data. However, existing methods i…