研究人员开发了一种新颖的方法,通过利用连续的Dyna循环来训练AI代理以应对复杂游戏。该方法仅在十人英雄多人在线战术竞技游戏(MOBA)的已学习世界模型中训练策略,真实游戏仅用于为世界模型更新和策略评估提供数据。训练好的策略在实际游戏中获胜率达到70.2%,与仅在想象中训练的零胜率相比有了显著提高。关键发现表明,模型利用难以在模拟环境中进行评估,并且在策略自身游戏场景下,在训练数据上准确的世界模型可能不准确,因此需要Dyna循环进行修复。 AI
影响 展示了一种在复杂环境中训练AI代理的新颖方法,有可能加速AI在策略游戏及其他领域的开发。
排序理由 详细介绍新AI训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →