一篇新发表在arXiv上的论文表明,即使在动作数量有限的情况下,Howard的策略迭代算法对于确定性马尔可夫决策过程也可能表现出指数级的迭代下界。这一发现确立了当折扣因子是输入的一部分时,该算法并非强多项式。该研究突显了去中心化的、自私的改进与协调的动作选择之间存在的显著差距,阐释了算法无政府状态的“代价”。 AI
影响 强调了决策算法的理论局限性,可能影响强化学习的未来研究。
排序理由 发表在arXiv上的学术论文,详细介绍了算法的理论局限性。[lever_c_demoted from research: ic=1 ai=1.0]
- algorithmic anarchy
- arXiv
- Dantzig's pivoting rule
- deterministic Markov decision processes
- Howard's policy iteration
- simplex algorithm
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →