PulseAugur
实时 09:26:02
English(EN) From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs

研究探讨折现马尔可夫决策过程中的转移核的可识别性

本文研究了仅凭最优动作即可识别马尔可夫决策过程(MDP)的哪些方面,而不是直接观察转移概率或Q值。该研究侧重于折现MDP下转移核的可识别性,探讨了不同形式的奖励(状态-动作、仅状态或状态-动作-下一状态)如何影响对底层动力学的学习。研究结果表明,知道所有状态-动作奖励的最优动作不足以唯一确定转移概率,揭示了一个产生相同最优动作的n(n-1)维核族。 AI

影响 这项研究有助于加深对强化学习动力学的理论理解,可能为未来的算法开发提供信息。

排序理由 关于强化学习理论方面的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究探讨折现马尔可夫决策过程中的转移核的可识别性

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Neal Batra ·

    从最优动作到世界模型:折现马尔可夫决策过程中的转移核的可识别性

    arXiv:2608.07301v1 Announce Type: new Abstract: We study what can be recovered about the transition probabilities of a Markov decision process from optimal actions alone. This is closely related to the inverse problem considered by Letcher et al., who ask when the dynamics can be…