PulseAugur
中
实时 19:40:59
实体 RMDPs

RMDPs

PulseAugur coverage of RMDPs — every cluster mentioning RMDPs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_277295 ·

    鲁棒马尔可夫决策过程的新线性规划表示和算法

    本文为鲁棒马尔可夫决策过程(RMDP)引入了新的线性规划(LP)表示和强多项式算法。研究侧重于奖励和转移不确定性的RMDP,特别是在有理多面体状态-动作矩形不确定性范围内。通过编码鲁棒策略迭代步骤,该研究构建了一个单一的LP,可以恢复最优鲁棒值和策略。本文还对鲁棒策略迭代进行了通用复杂度分析,从而改进了各种RMDP类型的复杂度界限,并为一般的区间、加权 $\ell_1$ 和 Wasserstein RMDPs 以及回合制随机博弈建立了…

  2. TOOL · CL_222307 ·

    新框架为鲁棒马尔可夫决策过程提供定量分析

    本文为具有 ω-正则目标的鲁棒马尔可夫决策过程(RMDP)引入了一个定量分析框架。该研究通过求解精确的定量值,扩展了先前的定性分析,该定量值代表了在所有智能体策略下,对抗敌对环境的保证满意度的上限。作者证明了智能体和环境都允许纯粹的、无记忆的最优策略,并提出了一种用于鲁棒马尔可夫链上定量奇偶校验的多项式时间算法,该算法随后用于 RMDP 的策略迭代算法。实验结果将这种新方法与归约到随机博弈的方法进行了比较。