PulseAugur
实时 11:01:21
English(EN) PureTD: Reinforcement Learning for Backgammon Money Games with No Evaluation-time Search

PureTD 模型在无需搜索的情况下取得了出色的双陆棋表现

研究人员开发了 PureTD,一个用于双陆棋 money games 的强化学习模型,该模型在评估时无需搜索即可达到接近最先进的性能。PureTD 仅通过自我对弈进行训练,证明了纯强化学习足以培养出色的双陆棋玩家。在有底池的双陆棋 money games 中,该模型显著优于 GNUbgOpen Sage 等开源引擎,即使这些引擎采用了单步前瞻搜索。 AI

影响 证明了纯自我对弈强化学习在复杂策略游戏中是有效的,可能影响其他领域的 AI 开发。

排序理由 该集群包含一篇详细介绍双陆棋新强化学习模型的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

PureTD 模型在无需搜索的情况下取得了出色的双陆棋表现

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Alexander L. Strehl ·

    PureTD:无需评估时搜索的西洋双陆棋金钱游戏的强化学习

    arXiv:2608.15146v1 Announce Type: new Abstract: We revisit Tesauro's TD-Gammon for backgammon money games in the setting of no evaluation-time search. Both checker play and cube action (use of the doubling cube) are learned from scratch via self-play reinforcement learning (RL), …