研究人员开发了一种用于随机环境中的基于模型的强化学习的新方法,该方法考虑了预测不确定性。该方法使用二次动作-价值参数化来简化贝尔曼备份,从而能够对预测均值和协方差进行解析传播。当与高斯转移模型和径向基值函数结合使用时,该方法会产生封闭形式的备份,从而减少目标方差,并在连续控制任务中提供经过良好校准的不确定性估计。 AI
影响 这项研究为在强化学习中使用学习到的分布模型进行规划提供了一个更具原则性的框架,有可能提高在随机环境中的性能。
排序理由 该条目是一篇学术论文,详细介绍了一种新的强化学习方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Bellman backup
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gaussian function
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →