本文为具有 ω-正则目标的鲁棒马尔可夫决策过程(RMDP)引入了一个定量分析框架。该研究通过求解精确的定量值,扩展了先前的定性分析,该定量值代表了在所有智能体策略下,对抗敌对环境的保证满意度的上限。作者证明了智能体和环境都允许纯粹的、无记忆的最优策略,并提出了一种用于鲁棒马尔可夫链上定量奇偶校验的多项式时间算法,该算法随后用于 RMDP 的策略迭代算法。实验结果将这种新方法与归约到随机博弈的方法进行了比较。 AI
影响 引入了一种新颖的定量分析方法,用于在不确定性下的鲁棒决策,有可能提高 AI 智能体在复杂环境中的性能。
排序理由 这是一篇研究论文,详细介绍了针对特定类型马尔可夫决策过程的新分析框架和算法。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- $L_1$-maximal regularity for quasilinear second order differential equation with damped term
- Markov Decision Processes
- RMDPs
- Stochastic Games
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →