PulseAugur
实时 22:12:08
实体 LunarLander

LunarLander

PulseAugur coverage of LunarLander — every cluster mentioning LunarLander across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_151841 ·

    AI策略被转化为可读的Prolog程序,以增强可解释性

    研究人员开发了一种新颖的三阶段流程,将深度强化学习策略转化为可执行的Prolog程序。该方法旨在通过将复杂AI模型的“黑箱”性质转化为可读可编辑的逻辑,使其更具可解释性。该系统保证了单调改进和终止,实证结果表明,在包括连续控制场景在内的各种任务上,Prolog程序可以媲美甚至超越原始神经网络的性能。

  2. TOOL · CL_127587 ·

    新方法改进了RL世界模型的检查点选择

    研究人员开发了一种从训练好的潜世界模型中选择最佳检查点的新方法,解决了传统验证指标(如损失和RMSE)即使在模型实际性能下降时仍可能持续改进的挑战。他们的方法称为复合奖励可观测性分数(CROF),使用了源自最优控制理论的诊断,其中奖励可观测性分数(ROF)是最强的单一预测因子。当应用于具有奖励塑造的LunarLander环境时,使用CROF选择的世界模型训练的策略,其回报比无模型基线高约24.5点,同时所需的交互环境次数显著减少。

  3. RESEARCH · CL_111264 ·

    新研究重新审视复杂强化学习空间中的动作分解 · 跟踪到2个来源

    一篇新的研究论文探讨了在强化学习中处理复杂动作空间的方法,特别是那些结合了离散动作和连续动作的动作空间。该研究分析了不同算法和环境中的各种分解技术,并引入了两个新的并行环境 CoopPush 和 Hybrid-Shoot 来促进这项研究。研究结果表明,分支对决架构在计算和性能之间取得了良好的平衡,而自回归动作(Auto-Regressive actions)取得了最高的整体性能,尽管原生连续 SAC 尽管计算成本更高,但表现更优。