PulseAugur
实时 08:57:42
English(EN) Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs

为受限平均奖励 MDP 建立了新的界限

研究人员在生成模型下,为受限平均奖励马尔可夫决策过程(CAMDPs)建立了近最优样本复杂度界限。所提出的基于模型的算法在宽松可行性方面实现了 $\tilde{O}(\frac{S A (B+H)}{ \epsilon^2})$ 的样本复杂度,在严格可行性方面实现了 $\tilde{O}(\frac{S A (B+H)}{ \epsilon^2 \zeta^2})$ 的样本复杂度。还证明了严格可行性情况下的匹配下界 $\tilde{\Omega}(\frac{S A (B+H)}{ \epsilon^2\zeta^2})$,这是 CAMDPs 的首个 minimax 最优界限,弥合了理论上的差距。 AI

影响 为约束下的决策制定奠定了理论基础,可能影响复杂环境中的 AI 代理。

排序理由 学术论文,详细介绍了特定类型马尔可夫决策过程的理论界限。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

为受限平均奖励 MDP 建立了新的界限

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Yukuan Wei, Xudong Li, Lin F. Yang ·

    受限平均奖励MDP的近最优样本复杂度界限

    arXiv:2509.16586v2 Announce Type: replace-cross Abstract: Recent advances have significantly improved our understanding of the sample complexity of learning in average-reward Markov decision processes (AMDPs) under the generative model. However, much less is known about the const…