PulseAugur
实时 08:09:55

将主动推理构建为凸马尔可夫决策过程,与强化学习统一

一篇新论文将主动推理(AIF)构建为凸马尔可夫决策过程(MDP),提出了一种将其与现代强化学习(RL)技术统一的方法。该研究认为,在AIF中最小化预期自由能(EFE)可以被视为潜在MDP中的策略优化,其中认知价值充当了表现性奖励。这种视角可以推导出一种与Actor-Critic方法和动态规划兼容的镜像下降算法,可能提供原则性的策略改进保证。 AI

影响 这项研究可以弥合人工智能中的理论框架,可能导致更强大、更具可解释性的强化学习代理。

排序理由 该条目是发表在arXiv上的学术论文,详细介绍了主动推理的一种新颖理论框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

将主动推理构建为凸马尔可夫决策过程,与强化学习统一

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Nikola Milosevic, Nicol\'as Hinrichs, Nico Scherf ·

    Active Inference as a Convex Markov Decision Process

    arXiv:2607.20152v1 Announce Type: cross Abstract: Active Inference (AIF) frames adaptive behavior as the minimization of expected free energy (EFE), combining epistemic and pragmatic objectives within a single variational principle. We frame AIF as policy optimization and show th…