研究人员推出了一种新的框架——鲁棒峰值成本约束强化学习(RP-CRL),该框架专为安全关键型应用设计,在这些应用中,单次成本违规可能导致灾难性后果。与现有方法不同,RP-CRL解决了峰值成本约束马尔可夫决策过程中可能存在的零对偶间隙缺失问题,并采用鲁棒公式来处理模拟与现实世界动力学之间的差异。所提出的解决方案利用了代理优化框架和积分概率度量来进行鲁棒价值估计,即使在动态扰动下也能有效执行安全策略并获得良好的奖励性能。 AI
影响 引入了一种新颖的强化学习框架,用于安全关键型应用,有望提高现实世界系统的可靠性。
排序理由 学术论文,介绍了一种新的强化学习技术框架。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX Code Finder for Papers
- Command And Data Processing
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- Markov decision process
- RP-CRL
- ScienceCast
- Shilpa Mukhopadhyay
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →