实体
Bellman recursion
Bellman recursion
PulseAugur coverage of Bellman recursion — every cluster mentioning Bellman recursion across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的FORE方法改进了离线强化学习评估
研究人员引入了拟合占用率评估(FORE),一种用于离线强化学习中估计占用率的新颖方法。该技术通过伴随贝尔曼递归来表征折扣占用率,并在每次迭代中解决密度比目标。FORE的关键创新在于其简化的近似条件,仅需要折扣占用率本身的实现性,而不是像贝尔曼完备性那样更复杂的条件。这种方法能够直接进行价值估计和双重鲁棒估计,为离线策略评估提供了更鲁棒的方法。
-
新的 PG-DPO 框架增强了用于非指数贴现的强化学习能力
研究人员开发了一个名为庞特里亚金引导的直接策略优化 (PG-DPO) 的新框架,以解决强化学习方法的局限性。使用贝尔曼风格递归的传统方法在处理非指数贴现时遇到困难,而非指数贴现常见于模拟人类偏好和生存场景。PG-DPO 放弃了递归,而是将庞特里亚金最大值原理与蒙特卡洛滚动相结合,在专业基准测试上实现了更高的准确性和稳定性。