一篇新论文将主动推理(AIF)构建为凸马尔可夫决策过程(MDP),提出了一种将其与现代强化学习(RL)技术统一的方法。该研究认为,在AIF中最小化预期自由能(EFE)可以被视为潜在MDP中的策略优化,其中认知价值充当了表现性奖励。这种视角可以推导出一种与Actor-Critic方法和动态规划兼容的镜像下降算法,可能提供原则性的策略改进保证。 AI
影响 这项研究可以弥合人工智能中的理论框架,可能导致更强大、更具可解释性的强化学习代理。
排序理由 该条目是发表在arXiv上的学术论文,详细介绍了主动推理的一种新颖理论框架。[lever_c_demoted from research: ic=1 ai=1.0]
- Active Inference
- actor-critic methods
- arXiv
- dynamic programming
- Markov decision process
- reinforcement learning
- world-model learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →