研究人员开发了一种名为先验引导探索的新方法,用于无搜索象棋引擎,旨在提高其超越简单模仿更强玩家的表现。该技术用前向Kullback-Leibler散度取代了标准的熵奖励,该散度将探索引导至网络自身搜索先验所识别的有希望的走法。该方法还结合了基于结果不确定性的自适应采样温度,从而提高了自我对弈强化学习中的战术准确性和博弈能力。 AI
影响 增强了AI在不依赖广泛搜索的情况下学习复杂策略的能力,可能适用于其他领域。
排序理由 该集群包含一篇详细介绍象棋AI新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- AlphaZero
- CatalyzeX
- Chessformer
- DagsHub
- Gotit.pub
- Hugging Face
- Kullback–Leibler divergence
- Leela Chess Zero
- Monte Carlo tree search
- reinforcement learning
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →