实体
Procgen
Procgen
PulseAugur coverage of Procgen — every cluster mentioning Procgen across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新研究提出AI泛化差距标准化指标
一篇新的arXiv论文提出了一种衡量强化学习中泛化差距的标准化方法,特别是在ProcGen环境中。作者认为,报告的泛化差距应与“随机基线”进行比较——即随机策略在相同关卡上的表现。他们的分析使用Proximal Policy Optimization (PPO)在八个ProcGen环境中进行,结果显示这种比较显著改变了标准指标的解释。该论文还强调了测试时动作采样和评估方面存在的问题,并指出许多当前实现可能无法准确反映真实的策略性能。
-
新方法增强了深度Q学习算法的稳定性
研究人员开发了一种新方法来稳定深度Q学习(DQL)算法的训练,该算法以其不稳定性而闻名。该研究从三个角度对不稳定性进行了统一分析:贝尔曼引导中的偏差、贪婪动作选择的敏感性以及具有侵略性数据重用的参数动态。所提出的稳定原则,包括受控引导和集成分位数估计,在Atari-100K和Procgen环境的实验中展示了具有竞争力的性能和改进的训练稳定性。
-
新研究详细介绍了逆动力学模型在模仿学习中的样本效率
一篇新的研究论文探讨了逆动力学模型(IDMs)在半监督模仿学习中的样本效率。研究表明,在一种称为基于IDM策略的极限情况下,VM-IDM和IDM标注方法学习到了相同的策略。研究人员将基于IDM策略的优越样本效率归因于其比专家策略更低的复杂度假设类和更低的随机性,这得到了统计学习理论以及在Procgen和LIBERO等基准测试上的实验支持。该论文还介绍了一种改进的用于潜在动作策略学习的LAPO算法。