PulseAugur
中
实时 20:00:09
实体 CartPole

CartPole

PulseAugur coverage of CartPole — every cluster mentioning CartPole across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_259396 ·

    新的无导数框架使 Muon 能够进行无梯度优化

    研究人员开发了一个无导数框架,用于将 Muon 优化方法改编到梯度不可用或不可靠的场景。这种新方法使用结构化有限差分来构建类似 Muon 的更新,提供了四种变体,包括随机低秩代理和直接结构化搜索。在矩阵回归和有噪声梯度任务上的实验表明,结构化探测可以显著减少所需函数评估的次数,有可能在特定黑盒问题中弥补不可靠的梯度预言机。

  2. TOOL · CL_252045 ·

    对抗性强化学习发现稀疏拒绝服务攻击以破坏自触发控制系统

    研究人员开发了一种新颖的对抗性强化学习方法,用于识别自触发控制系统中的漏洞。该方法侧重于寻找最稀疏的拒绝服务(DoS)攻击计划,这些计划能够破坏系统,类似于防御者使用的安全证书。该研究证明了对手造成崩溃所需的干扰次数的下限,并在 Pendulum、CartPole 和 Quadrotor2D 等模拟环境中,通过实证证明了所学习到的对手对各种控制器都有效。

  3. TOOL · CL_247756 ·

    新协议衡量AI中世界模型更新的价值

    研究人员开发了一种名为“fork ledger”的新协议,用于衡量持续学习场景中世界模型更新的实际价值。该方法在特定点分支部署流,从而可以直接比较应用更新与保持模型参数不变。在CartPole、Walker和Cheetah等控制任务上的实验表明,即使使用固定机制,持续应用更新也可能降低性能。

  4. TOOL · CL_219029 ·

    新方法利用时序逻辑增强连续系统的策略合成

    研究人员开发了一种用于连续状态随机动态系统策略合成的新方法,该方法使用线性时序逻辑来处理高级规范。他们的方法包括将动态系统与从规范派生的自动机进行组合,并在所得的乘积系统上解决最优规划问题。为了克服混合状态空间中的稀疏奖励问题,他们引入了一种广义的最优备份顺序,该顺序指导值备份并加速学习,同时保持最优性。提出了一种Actor-Critic强化学习算法,该算法利用增广拉格朗日方法进行策略评估,并采用模块化学习,为每个自动机状态使用单独的…

  5. TOOL · CL_219311 ·

    新的JAX实现解决了ES-HyperNEAT的扩展性瓶颈

    研究人员开发了JAX-ESHN,一个基于JAX的新实现,旨在GPU上并行化ES-HyperNEAT。该实现解决了先前限制坐标基神经演化扩展性的四叉树瓶颈。基准测试表明,JAX-ESHN在XOR和CartPole等任务上,尤其是在深度基底上,通过提供更低的运行时方差和更可靠的成功率,显著优于基于CPU的方法。该研究还确定了可扩展神经演化的结构约束,并提出EMR-HyperNEAT作为克服这些限制的重新表述。

  6. TOOL · CL_215879 ·

    新框架DYNAMICCARLENV通过动态上下文调度增强强化学习

    研究人员推出 DYNAMICCARLENV,这是一个旨在通过在训练回合中动态调度上下文变化来增强上下文强化学习的新框架。这种方法使强化学习策略能够接触到更结构化和多样化的环境参数空间,旨在提高性能,尤其是在分布外场景中。在 CartPole、BipedalWalker 和 VehicleRacing 环境中的实验表明,动态调度在性能上与静态上下文基线相当或优于静态上下文基线,并且在更复杂的任务中,在分布内性能方面有显著提高。

  7. TOOL · CL_187450 ·

    新的确定性世界模型增强了AI控制器验证

    研究人员开发了一种确定性世界模型(DWM),以改进用于安全关键系统的端到端图像控制器的形式化验证。该DWM将物理状态直接映射到合成摄像头图像,绕过了随机潜在变量的复杂性。在CARLA制动系统和多个Gym基准上的实验表明,与现有方法相比,DWM生成的精确可达管更精确,同时确保了与真实控制器的一致性。

  8. RESEARCH · CL_191168 ·

    LyEvO框架增强安全仿真到现实策略迁移 · 跟踪2个来源

    研究人员推出LyEvO,一个旨在增强从仿真到现实应用策略的安全性和鲁棒性的新框架。该方法集成了约束进化优化、统计模型检查和基于Lyapunov的稳定性分析。通过利用系统动力学知识,LyEvO计算初始稳定性区域,并通过联合优化和验证迭代改进它,提供部署就绪标准。在Cartpole和3D Quadrotor基准测试(包括真实世界实验)上的评估表明,成功实现了安全且鲁棒的仿真到现实迁移。

  9. TOOL · CL_151841 ·

    AI策略被转化为可读的Prolog程序,以增强可解释性

    研究人员开发了一种新颖的三阶段流程,将深度强化学习策略转化为可执行的Prolog程序。该方法旨在通过将复杂AI模型的“黑箱”性质转化为可读可编辑的逻辑,使其更具可解释性。该系统保证了单调改进和终止,实证结果表明,在包括连续控制场景在内的各种任务上,Prolog程序可以媲美甚至超越原始神经网络的性能。

  10. RESEARCH · CL_98147 ·

    新的OHIRL框架从无奖励感知流中学习 · 跟踪2个来源

    研究人员开发了一种新颖的在线奖励惩罚学习框架OHIRL,专为环境不提供明确奖励或标签的场景设计。OHIRL通过分析转换后果来推断诸如疼痛或错误等感知维度的效价。该框架将下一包预测、残余动力学建模、轨迹评估和策略更新的角色分开。在2x2-XOR、CartPole和Taxi等任务上的实验表明,OHIRL在最优动作选择和奖励符号预测方面能够达到高精度,优于各种对照方法。

  11. TOOL · CL_20450 ·

    Bilinear Mamba-Koopman Neural MPC 增强了在不同条件下的控制依赖动态

    研究人员开发了一种新的 Bilinear Mamba-Koopman Neural MPC 模型,该模型增强了具有不同动态的系统的模型预测控制。该模型在潜在动态中引入了控制依赖耦合,从而能够在单个控制范围内更好地适应不断变化的情况。在 CartPole 和 RSCP 基准测试上的实验表明,预测准确性和稳定性得到了提高,尤其是在时变场景和重新规划延迟的情况下。