PulseAugur
实时 11:56:20
实体 Bellman equation

Bellman equation

PulseAugur coverage of Bellman equation — every cluster mentioning Bellman equation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_154275 ·

    新的arXiv论文探讨基于风险的MDP和贝尔曼方程对偶

    两篇新发表在arXiv上的研究论文探讨了人工智能序贯决策中的高级概念。第一篇论文介绍了ERQDP,一种在基于风险的目标下进行有限时间马尔可夫决策过程规划的新方法,它提供了一种无需枚举的方法,并提供认证解决方案或明确的剩余差距。第二篇论文深入研究了贝尔曼方程的理论基础,展示了其递推性质如何源于与状态动力学、回报分解和不确定性聚合相关的三个基本条件,统一了强化学习、控制和决策理论中的概念。

  2. TOOL · CL_148010 ·

    新理论连接牛顿-拉夫逊方法与正则化策略迭代

    研究人员在正则化马尔可夫决策过程(RMDPs)的应用中,正式建立了牛顿-拉夫逊方法与正则化策略迭代(RPI)之间的等价性。这种联系,尤其是在正则化项为香农熵时,使得对RPI进行统一的理论分析并开发加速算法成为可能。研究表明,RPI表现出局部二次收敛性,并提出了一种实现三阶局部收敛的新算法,该算法得到了数值实验的支持。

  3. RESEARCH · CL_139161 ·

    新的CEFOL算法使用深度学习解决复杂的动态规划问题

    研究人员开发了一种名为CEFOL(Certainty-Equivalent First-Order Learning)的新型深度学习算法,旨在解决具有递归效用的复杂离散时间动态规划问题。该算法引入了一个单独的神经网络来表示确定性等价,从而能够有效利用通常难以评估的贝尔曼方程和一阶最优性条件。CEFOL还通过构建特定模型的一阶条件残差来学习值函数、策略函数和拉格朗日乘数,使其能够处理一般的等式和不等式约束,而无需进行特定问题的重构。该算…

  4. TOOL · CL_105946 ·

    Google DeepMind:强化学习智能体可能隐式建模环境

    Google DeepMind 的研究人员展示了一种通过反转贝尔曼方程来恢复智能体世界模型的方法,该方程通常用于确定最优策略。这项工作表明,强化学习(RL)智能体,即使是没有经过显式环境建模训练的智能体,也可以在其价值函数中隐式编码世界模型。这些发现挑战了对无模型智能体不学习环境表示的传统理解。