两篇新研究论文探讨了对抗性赌博优化,这是一种机器学习技术,其损失可能不是凸的且不光滑。第一篇论文介绍了一个用于凸损失和 beta-光滑损失的全局预算扰动的框架,并建立了预期遗憾保证。第二篇论文解决了分布式对抗性赌博问题,提出了一种黑盒方法,允许智能体通过流言通信最小化全局平均损失,实现了接近最优的遗憾界限。 AI
影响 这些论文推进了强化学习的理论理解,可能导致在复杂、不确定的环境中做出更鲁棒、更有效的决策算法。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了对抗性赌博优化方面的进展。
- arXiv
- cs.LG
- Hao Qiu
- I Ching
- Vojnovic
- Adversarial Bandit Optimization with Globally Bounded Perturbations to Convex Losses
- alphaXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →