实体
Ant-v5
Ant-v5
PulseAugur coverage of Ant-v5 — every cluster mentioning Ant-v5 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
强化学习算法增强机器容错能力
研究人员探索了使用强化学习(RL)算法,特别是近端策略优化(PPO)和软Actor-Critic(SAC),来增强机器的硬件容错能力。该研究系统地比较了这些RL方法,并研究了四种知识迁移策略。在模拟环境中评估了性能,结果表明RL可以实现快速、针对特定故障的恢复,不同的算法和策略在适应速度和渐近性能方面产生了不同的权衡。
-
新框架可视化AI控制中的运动阶段
研究人员开发了一个新框架,用于可视化深度强化学习(DRL)运动控制策略中的潜在运动阶段结构。该方法将聚类特征从仅状态观测扩展到包括动作和下一个状态,并引入了一种在最小化自转换的同时确定最佳聚类数量的技术。当应用于Ant-v5、HalfCheetah-v5和Walker2D-v5等环境时,与现有方法相比,所提出的方法成功识别出更清晰、更规则的阶段结构。