研究人员开发了一种新的算法来解决子模态马尔可夫决策过程(MDP),这是一种具有广义奖励函数的序贯决策问题。该算法基于线性规划(LP)技术和Sherali-Adams层级思想,为子模态定向和子模态MDP提供了强大的近似保证。这项工作改进了先前的近似比,特别是对于子模态MDP,其先前的保证与时间范围成线性关系。 AI
影响 为与强化学习相关的序贯决策问题引入了改进的算法保证。
排序理由 详细介绍特定类别决策问题的新算法和理论结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Markov decision processes
- Operations Research
- Reinforcement Learning
- Round-or-Cut
- ScienceCast
- Sherali-Adams
- Submodular Markov Decision Processes
- Submodular Orienteering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →