最近一篇发表在arXiv上的论文,题为“Time-Uniform Self-Normalized Concentration for Discounted Least Squares: Limits and Corrections”,指出了一个广泛使用的自归一化浓度不等式加权扩展中的缺陷。该论文通过一个高斯反例证明,在非平稳问题中,折扣最小二乘估计器的声称的时间一致保证是无效的。作者将证明错误归因于在不同终端时间使用不同的高斯混合分布,这阻止了单个超鞅的形成。他们为有限和无限范围提供了修正,并讨论了对后续分析的影响。 AI
影响 指出了强化学习分析中使用的理论基础存在缺陷,可能需要对后续研究进行修正。
排序理由 该集群包含一篇详细介绍机器学习分析中的理论发现和修正的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- CatalyzeX
- computer science
- DagsHub
- Gaussian function
- Gotit.pub
- Hugging Face
- IArxiv
- machine learning
- ScienceCast
- Sub-Gaussian distribution
- Time-Uniform Self-Normalized Concentration for Discounted Least Squares: Limits and Corrections
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →