研究人员开发了 PureTD,一个用于双陆棋 money games 的强化学习模型,该模型在评估时无需搜索即可达到接近最先进的性能。PureTD 仅通过自我对弈进行训练,证明了纯强化学习足以培养出色的双陆棋玩家。在有底池的双陆棋 money games 中,该模型显著优于 GNUbg 和 Open Sage 等开源引擎,即使这些引擎采用了单步前瞻搜索。 AI
影响 证明了纯自我对弈强化学习在复杂策略游戏中是有效的,可能影响其他领域的 AI 开发。
排序理由 该集群包含一篇详细介绍双陆棋新强化学习模型的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →