PulseAugur
实时 06:05:58

arXiv论文发现强化学习中浓度不等式证明存在错误

最近一篇发表在arXiv上的论文,题为“Time-Uniform Self-Normalized Concentration for Discounted Least Squares: Limits and Corrections”,指出了一个广泛使用的自归一化浓度不等式加权扩展中的缺陷。该论文通过一个高斯反例证明,在非平稳问题中,折扣最小二乘估计器的声称的时间一致保证是无效的。作者将证明错误归因于在不同终端时间使用不同的高斯混合分布,这阻止了单个超鞅的形成。他们为有限和无限范围提供了修正,并讨论了对后续分析的影响。 AI

影响 指出了强化学习分析中使用的理论基础存在缺陷,可能需要对后续研究进行修正。

排序理由 该集群包含一篇详细介绍机器学习分析中的理论发现和修正的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

arXiv论文发现强化学习中浓度不等式证明存在错误

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yi-Shan Wu ·

    面向折扣最小二乘法的时间均匀自归一化浓度:极限与修正

    arXiv:2608.19643v1 Announce Type: new Abstract: Self-normalized concentration inequalities are standard tools in bandit and reinforcement-learning analyses. A widely used weighted extension claims an analogous time-uniform guarantee for discounted least-squares estimators in non-…