实体
AntMaze
AntMaze
PulseAugur coverage of AntMaze — every cluster mentioning AntMaze across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新方法CSDG增强离线强化学习
研究人员推出了一种用于离线强化学习的新方法——凸包邻域平滑对偶泛化(CSDG)。CSDG通过显式地将样本内价值目标与泛化贡献分离开来,解决了分布外动作中估计误差放大的问题。该方法采用一种带有扰动半径和平滑系数的平滑技术来控制泛化目标的权重。在Gym-MuJoCo和AntMaze基准测试上的实验表明,CSDG表现出色且价值估计稳定。
-
研究论文批评AI策略搜索中的对比批评者
一篇题为“Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search”的新研究论文探讨了AI策略搜索中对比批评者的局限性。该论文表明,虽然好的动作排名不能保证安全性,但无界的双线性分数会膨胀非支持值。研究表明,余弦边界不能解决这个问题,分解将遗憾归因于范数漂移。研究发现,在多个OGBench导航任务中,对比批评者在最…
-
新研究探讨离线 GCRL 中的可训练性和可提取性
研究人员开发了一种新的方法来评估离线目标条件强化学习(GCRL),超越了单纯的成功率。该研究引入了“可训练性景观”来可视化不同的优化参数如何影响方法学习和将目标条件信号提取到策略中的能力。这种方法揭示了高分方法可能易于广泛访问,也可能脆弱,并且仅仅峰值性能并不能保证可提取的行为。研究结果表明,分析这些景观并使用提取诊断可以更细致地理解 GCRL 方法的性能。