研究人员开发了一个名为基于重分布的成本推断(RCI)的新框架,以改进离线环境中的安全强化学习。该方法通过将二元停止反馈转换为密集的每步成本,解决了稀疏的、轨迹级别的反馈的挑战。在高速公路驾驶和机器人操作任务上的实验表明,与现有基线相比,RCI显著降低了违规率,并对不同的数据集和噪声标签表现出鲁棒性。 AI
影响 该框架可能在自动驾驶和机器人等实际应用中带来更强大、更安全的AI系统。
排序理由 该集群包含一篇详细介绍强化学习新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Highway Driving
- Hugging Face
- Redistribution-based Cost Inference
- Robotic Manipulation
- Safe offline RL
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →