两篇arXiv论文深入探讨了上下文老虎机算法的复杂性。第一篇论文《具有记忆的广义线性老虎机》改进了线性和广义线性模型的遗憾界限,尽管存在非线性奖励和记忆效应,仍达到了 $\tilde{O}(\sqrt{T})$ 的速率。第二篇论文《有限动作线性上下文老虎机中的顺序批量学习》解决了批量决策的挑战,为具有固定批量约束的场景建立了遗憾界限和算法,适用于个性化治疗和推荐系统等领域。 AI
影响 这些论文在不确定性下的序贯决策方面推进了理论理解和算法方法,可能改进个性化系统。
排序理由 两篇发表在arXiv上的学术论文,详细介绍了上下文老虎机算法的进展。
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Clerici et al.
- CORE Recommender
- DagsHub
- Generalized Linear Bandits with Memory
- Gotit.pub
- Hugging Face
- ScienceCast
- Sequential Batch Learning in Finite-Action Linear Contextual Bandits
- Yanjun Han
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →