PulseAugur
中
实时 14:39:25
实体 Defensive Policy Gradient

Defensive Policy Gradient

PulseAugur coverage of Defensive Policy Gradient — every cluster mentioning Defensive Policy Gradient across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_280403 ·

    防御性策略梯度算法提高了强化学习的样本复杂度

    一种名为防御性策略梯度(DPG)的新算法已被开发出来,它改进了现有的强化学习方差缩减策略梯度方法。与先前需要对方差做出不切实际假设的方法不同,DPG 在没有这些限制的情况下实现了 O(ε−3) 的改进样本复杂度。该研究还为策略优化建立了理论下界,表明 DPG 的更快收敛速度是最优的。