PulseAugur
实时 11:24:04
实体 CartPole

CartPole

PulseAugur coverage of CartPole — every cluster mentioning CartPole across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_187450 ·

    新的确定性世界模型增强了AI控制器验证

    研究人员开发了一种确定性世界模型(DWM),以改进用于安全关键系统的端到端图像控制器的形式化验证。该DWM将物理状态直接映射到合成摄像头图像,绕过了随机潜在变量的复杂性。在CARLA制动系统和多个Gym基准上的实验表明,与现有方法相比,DWM生成的精确可达管更精确,同时确保了与真实控制器的一致性。

  2. TOOL · CL_151841 ·

    AI策略被转化为可读的Prolog程序,以增强可解释性

    研究人员开发了一种新颖的三阶段流程,将深度强化学习策略转化为可执行的Prolog程序。该方法旨在通过将复杂AI模型的“黑箱”性质转化为可读可编辑的逻辑,使其更具可解释性。该系统保证了单调改进和终止,实证结果表明,在包括连续控制场景在内的各种任务上,Prolog程序可以媲美甚至超越原始神经网络的性能。

  3. RESEARCH · CL_98147 ·

    新的OHIRL框架从无奖励感知流中学习 · 跟踪2个来源

    研究人员开发了一种新颖的在线奖励惩罚学习框架OHIRL,专为环境不提供明确奖励或标签的场景设计。OHIRL通过分析转换后果来推断诸如疼痛或错误等感知维度的效价。该框架将下一包预测、残余动力学建模、轨迹评估和策略更新的角色分开。在2x2-XOR、CartPole和Taxi等任务上的实验表明,OHIRL在最优动作选择和奖励符号预测方面能够达到高精度,优于各种对照方法。

  4. TOOL · CL_20450 ·

    Bilinear Mamba-Koopman Neural MPC 增强了在不同条件下的控制依赖动态

    研究人员开发了一种新的 Bilinear Mamba-Koopman Neural MPC 模型,该模型增强了具有不同动态的系统的模型预测控制。该模型在潜在动态中引入了控制依赖耦合,从而能够在单个控制范围内更好地适应不断变化的情况。在 CartPole 和 RSCP 基准测试上的实验表明,预测准确性和稳定性得到了提高,尤其是在时变场景和重新规划延迟的情况下。