一篇新发表在arXiv上的论文介绍了一种广义贝尔曼递推,为序贯决策问题提供了一个统一的框架。研究表明,最优价值函数的递推结构源于三个特定条件:通过充分统计量分解动力学、回报的递推分解以及不确定性聚合的兼容性。当满足这些条件时,贝尔曼方程就从它们的一致性中涌现出来,而偏差可以通过状态增强或回报/动力学变形来管理。该框架还揭示了三个对偶——概率与回报之间、回报与聚合之间、以及聚合与概率之间——统一了强化学习、控制和决策理论中各种不同的方法。 AI
影响 为强化学习中使用的方法提供了统一的理论基础,有望带来更强大、更具泛化能力的AI代理。
排序理由 发布在arXiv上的学术论文,详细介绍了序贯决策的新理论框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →