实体
Bellman operator
Bellman operator
PulseAugur coverage of Bellman operator — every cluster mentioning Bellman operator across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的 CVaR MDP 公式通过 Bellman 算子增强了风险敏感策略学习
研究人员开发了一种新颖的马尔可夫决策过程 (MDP) 静态条件风险价值 (CVaR) 目标公式,以更好地处理安全关键应用中的尾部风险。他们的方法引入了一个 Bellman 算子,该算子提供密集的每步奖励,并在有界值函数的整个空间中表现出收缩特性,从而避免了先前方法的稀疏奖励和退化不动点。这一理论基础使得风险规避值迭代和无模型 Q-学习算法得以发展,这些算法在实证测试中已证明了有效的性能-安全权衡以及学习 CVaR 敏感策略的能力。
-
新框架应对多智能体强化学习中的模型不匹配问题
研究人员开发了一个新的固定鲁棒均值场博弈框架,以应对在实际场景中部署多智能体强化学习(MARL)所面临的挑战。该框架解决了训练模拟器与实际环境之间的模型不匹配问题,这可能导致性能下降。它通过在不确定集内针对最坏情况的转移模型优化策略来引入分布鲁棒性,为缓解这些问题提供了一种原则性的方法。该论文建立了一个鲁棒动态规划原理,并证明了固定鲁棒均值场均衡的存在性,同时提供了一个具体的算法和收敛性保证。