本文研究了仅凭最优动作即可识别马尔可夫决策过程(MDP)的哪些方面,而不是直接观察转移概率或Q值。该研究侧重于折现MDP下转移核的可识别性,探讨了不同形式的奖励(状态-动作、仅状态或状态-动作-下一状态)如何影响对底层动力学的学习。研究结果表明,知道所有状态-动作奖励的最优动作不足以唯一确定转移概率,揭示了一个产生相同最优动作的n(n-1)维核族。 AI
影响 这项研究有助于加深对强化学习动力学的理论理解,可能为未来的算法开发提供信息。
排序理由 关于强化学习理论方面的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Deterministic policy gradient algorithms for semi‐Markov decision processes
- Letcher et al.
- Markov decision process
- Next-state functions for finite-state vector quantization
- policy
- Q-values
- Rewards and Fairies
- state-action rewards
- STATE REWARDS FOR MEDICAL DISCOVERIES
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →