PulseAugur
实时 17:21:55
English(EN) Scalable Causal Imitation Learning

新的因果模仿学习算法在复杂任务上表现优于先前方法

研究人员开发了新的因果模仿学习(CIL)算法,即因果软Q模仿学习(SQIL)和因果逆软Q学习(IQ-Learn),以解决现有CIL方法在应用于复杂、长时序任务时的局限性。这些新算法利用了具有先进逆强化学习目标的因果调整框架,并利用了序列$\pi$-后门标准的有效近似。通过利用连续控制环境的因果结构,它们减小了调整窗口,从而在混淆的长时序任务上显著提高了性能,甚至在某些情况下超越了专家性能。 AI

影响 这些新算法为在复杂、现实场景中从专家演示中学习的AI代理提供了改进的性能。

排序理由 该集群包含一篇详细介绍模仿学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的因果模仿学习算法在复杂任务上表现优于先前方法

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Eylam Tagor, Mingxuan Li, Elias Bareinboim ·

    可扩展因果模仿学习

    arXiv:2607.17003v1 Announce Type: cross Abstract: Imitation learning enables learning a policy in an unknown environment with a latent reward signal using expert demonstrations, but it struggles when the imitator's and expert's observations are mismatched and unobserved confounde…