PulseAugur
实时 14:59:12
实体 RP-CRL

RP-CRL

PulseAugur coverage of RP-CRL — every cluster mentioning RP-CRL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_151974 ·

    新的强化学习框架解决灾难性安全违规问题

    研究人员推出了一种新的框架——鲁棒峰值成本约束强化学习(RP-CRL),该框架专为安全关键型应用设计,在这些应用中,单次成本违规可能导致灾难性后果。与现有方法不同,RP-CRL解决了峰值成本约束马尔可夫决策过程中可能存在的零对偶间隙缺失问题,并采用鲁棒公式来处理模拟与现实世界动力学之间的差异。所提出的解决方案利用了代理优化框架和积分概率度量来进行鲁棒价值估计,即使在动态扰动下也能有效执行安全策略并获得良好的奖励性能。