研究人员在生成模型下,为受限平均奖励马尔可夫决策过程(CAMDPs)建立了近最优样本复杂度界限。所提出的基于模型的算法在宽松可行性方面实现了 $\tilde{O}(\frac{S A (B+H)}{ \epsilon^2})$ 的样本复杂度,在严格可行性方面实现了 $\tilde{O}(\frac{S A (B+H)}{ \epsilon^2 \zeta^2})$ 的样本复杂度。还证明了严格可行性情况下的匹配下界 $\tilde{\Omega}(\frac{S A (B+H)}{ \epsilon^2\zeta^2})$,这是 CAMDPs 的首个 minimax 最优界限,弥合了理论上的差距。 AI
影响 为约束下的决策制定奠定了理论基础,可能影响复杂环境中的 AI 代理。
排序理由 学术论文,详细介绍了特定类型马尔可夫决策过程的理论界限。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX Code Finder for Papers
- Constrained average-reward MDPs
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- Markov decision processes
- ScienceCast
- Yukuan Wei
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →