研究人员开发了一种名为交错投影梯度下降(IPGD)的新型模仿学习技术,旨在训练神经网络控制策略,同时遵守状态和输入约束。该方法将标准的模仿梯度步骤与安全步骤交替进行,安全步骤将动作投影到安全集合上,旨在满足训练过程中的约束并提高在实际应用中的性能。在自动驾驶赛车任务的模拟中,与基于惩罚的方法相比,IPGD 显著减少了约束违反,在达到可比的单圈时间的同时,表现出对参数调整更大的鲁棒性。 AI
影响 增强了约束环境中神经网络控制策略的安全性和鲁棒性。
排序理由 该集群包含一篇详细介绍模仿学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Autonomous racing task
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- imitation learning
- Interleaved Projected Gradient Descent
- neural-network control policies
- Projected Gradient Descent
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →