本文介绍了一种分析结构化马尔可夫决策过程(MDP)中最优策略的新几何理论。它提出,决策边界的几何形状,而非状态空间的大小,决定了策略重构和表示的复杂性。该研究建立了边界和决策复杂度的内在度量,推导了决策压缩的信息论界限,并为使用黑盒查询进行边界估计和策略重构提供了统计保证。数值实验支持该框架的理论预测。 AI
影响 引入了一个分析序贯决策的新理论框架,可能影响AI代理和强化学习研究。
排序理由 该条目是发表在arXiv上的学术论文,详细介绍了一个新的理论框架。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- decision-boundary geometry
- dynamic programming
- Fredy POKOU
- Hugging Face
- Markov decision processes
- oracle-query complexity
- policy reconstruction
- representation complexity
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →