PulseAugur
实时 07:12:04
实体 world-model learning

world-model learning

PulseAugur coverage of world-model learning — every cluster mentioning world-model learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_158492 ·

    将主动推理构建为凸马尔可夫决策过程,与强化学习统一

    一篇新论文将主动推理(AIF)构建为凸马尔可夫决策过程(MDP),提出了一种将其与现代强化学习(RL)技术统一的方法。该研究认为,在AIF中最小化预期自由能(EFE)可以被视为潜在MDP中的策略优化,其中认知价值充当了表现性奖励。这种视角可以推导出一种与Actor-Critic方法和动态规划兼容的镜像下降算法,可能提供原则性的策略改进保证。