一篇新研究论文介绍了 CVaR-UCBVI 的无连续性近最小极大领先阶遗憾算法。该算法在有限时间表 CVaR 强化学习中实现了 \\(\\widetilde{O}(\\sqrt{SAK/\\tau})\\) 的更优遗憾率,且无需连续性假设。关键创新是对情节缺口的条件方差进行了自界定,将其代入 Bernstein 分解后,可为各种回报定律带来近乎最小极大最优的遗憾。 AI
影响 这项研究推进了强化学习的理论理解,有望为复杂的决策任务带来更高效的算法。
排序理由 该集群包含一篇详细介绍强化学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- arXivLabs
- Bernstein CVaR-UCBVI
- CatalyzeX
- CVaR-UCBVI
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →