两篇新的arXiv论文深入探讨了时序差分(TD)学习方法的理论基础,重点关注其有限迭代行为和在线统计推理。第一篇由Ege Can Kaya撰写的论文分析了标量和多变量设置下的异步分类TD学习,建立了折扣界限和有限迭代保证。第二篇论文研究了回报分布函数量的在线推理,证明了根T误差弱收敛到高斯随机元素,并为各种统计函数量证明了bootstrap推理的合理性。 AI
影响 这些论文推进了对时序差分学习的理论理解,可能导致更强大、更有效的强化学习算法。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了机器学习算法的理论进展。
- alphaXiv
- arXiv
- CatalyzeX
- Cramér space
- CVaR
- DagsHub
- Gotit.pub
- Hugging Face
- Polyak--Ruppert
- ScienceCast
- CatalyzeX Code Finder for Papers
- Cramér geometry
- Ege Can Kaya
- maximum mean discrepancy geometry
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →