研究人员为上下文组合半老虎机问题开发了新算法,该问题涉及选择臂的子集以最大化累积奖励。其中一种方法,在最近的 arXiv 论文中提出,通过解决一个凸优化问题,提供了一种计算高效的方法来平衡探索和利用。该算法实现了 minimax 最优遗憾界限,并推广到任意组合动作结构和奖励函数逼近。另一篇论文侧重于预言机高效框架,显著减少了这些问题所需的预言机查询次数,特别是在最坏情况下的线性奖励设置中,同时保持了严格的遗憾保证。 AI
影响 这些在老虎机算法方面的进展可能导致在需要具有部分反馈的顺序选择的系统中,如推荐引擎或资源分配,实现更高效的决策。
排序理由 该集群包含两篇在 arXiv 上发表的学术论文,详细介绍了组合半老虎机问题的新算法和理论保证。
- Jung-Hun Kim
- alphaXiv
- arXiv
- arXivLabs
- CatalyzeX Code Finder for Papers
- Connected Papers
- Contextual Combinatorial Semi-Bandits
- convex optimization
- CORE Recommender
- DagsHub
- General function approximation of a class of cascade chaotic fuzzy systems
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Litmaps
- machine learning
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →