PulseAugur
实时 21:23:22
English(EN) Generalised Bellman recurrence and three dualities in sequential decision-making

新框架统一了序贯决策中的贝尔曼方程和对偶

一篇新发表在arXiv上的论文介绍了一种广义贝尔曼递推,为序贯决策问题提供了一个统一的框架。研究表明,最优价值函数的递推结构源于三个特定条件:通过充分统计量分解动力学、回报的递推分解以及不确定性聚合的兼容性。当满足这些条件时,贝尔曼方程就从它们的一致性中涌现出来,而偏差可以通过状态增强或回报/动力学变形来管理。该框架还揭示了三个对偶——概率与回报之间、回报与聚合之间、以及聚合与概率之间——统一了强化学习、控制和决策理论中各种不同的方法。 AI

影响 为强化学习中使用的方法提供了统一的理论基础,有望带来更强大、更具泛化能力的AI代理。

排序理由 发布在arXiv上的学术论文,详细介绍了序贯决策的新理论框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架统一了序贯决策中的贝尔曼方程和对偶

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Fernando E. Rosas, David Hyland, Daniel Polani ·

    序列决策中的广义贝尔曼递推和三个对偶

    arXiv:2607.18077v1 Announce Type: cross Abstract: What gives the Bellman equation its form? We show that the recursive properties of optimal value functions follow from three conditions: that the dynamics decomposes through sufficient statistics, that the return decomposes recurs…