研究人员引入了一个新的贝尔曼最优方程,专门用于优化持续强化学习中的塑性。这项工作建立在先前的一个形式化基础上,该形式化将稳定性-塑性权衡重新定义为赋能-塑性权衡,其中塑性由从观测到动作的有向信息定义,赋能由从动作到观测的有向信息定义。虽然赋能问题已被广泛研究,但本文首次尝试在马尔可夫决策过程中,在这一新定义下解决塑性优化问题。 AI
影响 引入了一个新颖的数学框架,用于优化持续强化学习中的塑性,可能提高智能体的适应性。
排序理由 该集群包含一篇学术论文,详细介绍了强化学习的新理论框架和方程。[lever_c_demoted from research: ic=1 ai=1.0]
- Abel et al.
- Bellman optimality equation
- directed information
- empowerment
- Markov decision processes
- plasticity
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →