PulseAugur
中
实时 20:47:08
实体 offline policy learning

offline policy learning

PulseAugur coverage of offline policy learning — every cluster mentioning offline policy learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_286423 ·

    大规模离线策略学习研究训练了超过 16 万个策略

    一项新研究在 114 个数据集上训练了超过 16 万个策略,以研究影响强化学习和模仿学习中离线策略学习的因素。研究发现,没有单一算法能始终占主导地位,顶尖方法的性能通常非常接近,但因环境而异。适当的超参数调整被证明会频繁改变算法的排名,而基准测试的构成可能导致相互矛盾的结论。为了提高研究的可靠性,该研究引入了 JumpStart,这是一个资源套件,包括所有训练过的策略、分数和超参数、基线和代码,以及一个用于分析和贡献的网站。