研究人员开发了新的因果模仿学习(CIL)算法,即因果软Q模仿学习(SQIL)和因果逆软Q学习(IQ-Learn),以解决现有CIL方法在应用于复杂、长时序任务时的局限性。这些新算法利用了具有先进逆强化学习目标的因果调整框架,并利用了序列$\pi$-后门标准的有效近似。通过利用连续控制环境的因果结构,它们减小了调整窗口,从而在混淆的长时序任务上显著提高了性能,甚至在某些情况下超越了专家性能。 AI
影响 这些新算法为在复杂、现实场景中从专家演示中学习的AI代理提供了改进的性能。
排序理由 该集群包含一篇详细介绍模仿学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Causal Behavioral Cloning
- Causal Generative Adversarial Imitation Learning
- Causal IQ-Learn
- Causal Soft Q Imitation Learning
- DagsHub
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →