Safe RL
PulseAugur coverage of Safe RL — every cluster mentioning Safe RL across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新型攻击利用演示来破坏安全强化学习机器人控制器
研究人员开发了一种新的方法来攻击机器人系统中使用的黑盒安全强化学习(Safe RL)控制器。这种演示引导观察攻击可以通过恢复代理策略并从演示转换中学习动态来识别安全违规,而无需访问受害者网络的参数或梯度。在各种机器人任务和预算条件下,该攻击被证明比现有方法更有效,突显了用于安全学习的演示也可以作为攻击面。虽然状态对抗正则化在防御方面显示出希望,但其他测试方法提供的保护不一致。
-
新基准揭示无重置强化学习智能体难以处理不可逆动作
研究人员推出了 REVERSAL-BENCH,这是一个新的基准测试,旨在衡量无重置强化学习智能体在具有不可逆动作的环境中的局限性。该基准测试控制了可逆性的程度,并包含一个重置预言机,用于跨各种物理引擎和操作任务验证状态的可恢复性。评估显示了一个显著的“可逆性悬崖”,即在外部重置下训练的智能体随着环境不可逆性的增加而挣扎并陷入无法恢复的状态,而具有情节的智能体则保持稳定的学习。
-
新算法实现人工智能策略从仿真到现实的安全迁移
研究人员开发了一种新颖的强化学习安全仿真到现实迁移算法,解决了在模拟器中训练的策略部署到现实世界中的挑战。该算法利用模拟器信息,最大限度地减少现实世界的数据收集,同时确保安全探索并学习近乎最优的策略。这种方法对于机器人和医疗保健等现实世界数据收集受安全因素限制的应用尤其重要。
-
新方法增强了分层强化学习任务的安全性
研究人员开发了一种新颖的方法来增强分层强化学习的安全性,特别是在复杂、长时限的任务中。该方法利用学习到的世界模型,结合用于生成子目标的高层策略和采用想象性回滚来防止不安全行为的低层策略。与具有挑战性的导航和操作任务上现有的安全强化学习基线相比,该技术显著提高了成功率并确保了一致的约束满足。
-
新基准测试AI在道德困境中的层级道德对齐能力
研究人员开发了MoralityGym,一个旨在评估AI代理在复杂道德困境中导航和遵守层级道德规范能力的新基准。该基准使用一种称为Morality Chains的新形式主义来表示道德约束,并在Gymnasium环境中呈现了98个电车难题风格的问题。使用安全强化学习(Safe RL)方法的初步测试突显了AI在道德推理方面的现有局限性,表明需要更先进的方法来确保AI系统在现实场景中以合乎道德且透明的方式运行。