研究人员开发了一种新颖的统一方法,用于建立随机逼近(SA)算法的均方界限和集中界限。该方法处理任意范数下的收缩映射和乘性噪声模型,这些在强化学习中很常见。新技术避免了复杂的平滑或包络构造,而是使用平均噪声序列和辅助迭代来推导直接的李雅普诺夫漂移不等式。这使得SA在乘性噪声下首次获得亚高斯尾部最大集中界限,步长可以对置信度进行对数依赖。 AI
影响 这项研究推进了对强化学习中使用的算法的理论理解,可能导致更强大、更高效的AI系统。
排序理由 学术论文发布在arXiv上,详细介绍了一种用于随机逼近算法的新数学方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Azuma-Hoeffding bound
- cs.LG
- $\ell_\infty$ norm
- Moreau envelope
- reinforcement learning
- stochastic approximation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →