PulseAugur
实时 06:55:13
实体 categorical policies

categorical policies

PulseAugur coverage of categorical policies — every cluster mentioning categorical policies across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_169775 ·

    新的DRPO方法解决了离策略强化学习中的负更新问题

    一篇新研究论文介绍了一种动态远程感知策略优化(DRPO)方法,该方法旨在通过解决负更新问题来改进离策略强化学习。论文解释了过度重用负优势样本如何导致排斥,从而引起不稳定和有限均衡的损失。DRPO旨在通过减弱远程负更新的影响同时保留有用的局部反馈来缓解这一问题,从而恢复稳定的策略更新并提高性能。