研究人员开发了BCPPO(受巴歇尔启发的约束近端策略优化),一种旨在减轻尾部风险的安全强化学习新方法。与现有方法在处理噪声梯度或复杂分布建模方面遇到的困难不同,BCPPO利用了单独初始化的成本预测网络之间的分歧来创建平滑的策略更新惩罚。该惩罚源自巴歇尔公式,有助于在不改变时序差分学习中的评估器的情况下,平衡奖励最大化与成本预测的谨慎性。在Push1等任务上的评估表明,与其它方法相比,BCPPO在均值回报和条件在险价值(CVaR)方面取得了更好的平衡。 AI
影响 引入了一种安全强化学习的新方法,有可能在具有高后果的罕见事件场景中改进AI的决策。
排序理由 该集群描述了一篇关于一种新的强化学习方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →