PulseAugur
实时 09:16:36

新的分析规划方法应对强化学习中的不确定性

研究人员开发了一种用于随机环境中的基于模型的强化学习的新方法,该方法考虑了预测不确定性。该方法使用二次动作-价值参数化来简化贝尔曼备份,从而能够对预测均值和协方差进行解析传播。当与高斯转移模型和径向基值函数结合使用时,该方法会产生封闭形式的备份,从而减少目标方差,并在连续控制任务中提供经过良好校准的不确定性估计。 AI

影响 这项研究为在强化学习中使用学习到的分布模型进行规划提供了一个更具原则性的框架,有可能提高在随机环境中的性能。

排序理由 该条目是一篇学术论文,详细介绍了一种新的强化学习方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的分析规划方法应对强化学习中的不确定性

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Shishir Sharma, Doina Precup ·

    Analytic Planning under Uncertainty with Moment Closure

    arXiv:2608.02519v1 Announce Type: new Abstract: Effective model-based reinforcement learning in stochastic environments requires planning that accounts for predictive uncertainty. Propagating full state distributions analytically offers a principled way to do this, but has tradit…