研究人员开发了一种新方法,使自主代理能够学习和推理具有隐藏状态的系统,这个问题通常被表述为学习离散的部分可观察马尔可夫决策过程(POMDP)。代理从POMDP的动作和观察空间知识开始,但必须从顺序数据中构建其状态空间、转移和观察模型。所提出的方法基于预测状态表示(PSRs)等谱方法,通过张量分解估计相似变换来学习POMDP矩阵。该方法允许在模型学习后为不同的目标和奖励函数生成新计划,并且还表明仅从顺序数据中学习超出状态分区的POMDP是不可能的。 AI
影响 使人工智能代理能够学习和推理具有隐藏状态的系统,从而可能改善复杂环境中的决策。
排序理由 该集群包含一篇详细介绍学习POMDP新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- DagsHub
- Gotit.pub
- Hugging Face
- partially observable Markov decision process
- Predictive State Representations
- ScienceCast
- Seiji Shaw
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →