研究人员开发了Dual-Force,这是一种新的离线算法,旨在增强模仿约束下的多样性最大化。该方法旨在将演示数据转化为不同的行为策略,从而在无需额外环境交互的情况下提高对分布变化的鲁棒性。Dual-Force通过使用范德华力目标的离策略估计器来实现这一点,该估计器消除了对技能判别器的需求,并通过预训练的功能奖励编码通过内在奖励稳定训练。 AI
影响 通过改进AI如何从演示数据中学习,该算法有望在实际应用中带来更鲁棒和多样化的AI行为。
排序理由 该集群包含一篇详细介绍新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →