PulseAugur
中
实时 09:34:18
实体 Natural Policy Gradient Methods with Parameter-based Exploration for Control Tasks

Natural Policy Gradient Methods with Parameter-based Exploration for Control Tasks

PulseAugur coverage of Natural Policy Gradient Methods with Parameter-based Exploration for Control Tasks — every cluster mentioning Natural Policy Gradient Methods with Parameter-based Exploration for Control Tasks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_212098 ·

    新分析探讨自然Actor-Critic算法的加速收敛

    研究人员分析了一种单循环、熵正则化的自然Actor-Critic算法,重点关注其在非正则化目标上的收敛速度。该研究探讨了两种优化机制:随机优化,使用联合Lyapunov递推;以及确定性优化,采用策略镜像下降。通过引入指数平移机制并利用正的最小作用间隙,该算法实现了加速收敛速度,在特定情况下优于现有方法。

  2. TOOL · CL_167113 ·

    新研究为自然策略梯度算法提供有限时间收敛保证

    一篇新发表在arXiv上的研究论文首次为有限时间马尔可夫决策过程中的自然策略梯度(NPG)算法提供了有限时间收敛保证。该研究在恒定步长和递增步长两种情况下分析了NPG,证明了恒定步长下的次线性收敛率和递增步长下的线性收敛率。这些发现对强化学习具有重要意义,因为NPG是Trust Region Policy Optimization和Proximal Policy Optimization等流行方法的基础。