研究人员开发了一个新的框架,用于分析一般Borel状态空间上的Restart POMDPs(部分可观察马尔可夫决策过程)。该框架通过使用一个包含最后一个观察到的状态和自上次重启以来经过的时间的充分统计量表示,将问题简化为完全可观察的MDP。在特定的成本恶化条件下,该研究证明了对于折扣成本和总非折扣成本标准,最优策略在经过时间上表现出阈值结构。进一步分析表明,对于具有随机单调核的部分有序状态空间,最优阈值随着状态的增加而减小。对于平均成本标准,在满足某些遍历性和瞬态增益支配假设的情况下,使用消失折扣方法建立了类似的阈值结果。 AI
影响 这项研究有助于对部分可观察环境中的最优控制策略的理论理解,可能为未来AI代理的设计提供信息。
排序理由 该集群包含一篇在arXiv上发表的研究论文,详细介绍了分析特定类型马尔可夫决策过程的新理论框架。[lever_c_demoted from research: ic=1 ai=0.7]
- alphaXiv
- arXiv
- Borel state space
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Konstantin E. Avrachenkov
- Markov decision process
- Restart POMDP
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →