研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架允许将非增量学习器(如梯度提升树,GBT)有效地用于强化学习(RL)环境。这种方法将数据收集与模型拟合分离开来,使 GBT 能够克服通常阻碍其在 RL 中使用的分布偏移问题。LUGL 在有限表格中累积表格更新与使用该表格训练可泛化函数逼近器之间交替进行。在各种完全信息和不完全信息游戏中的实验表明,LUGL(特别是使用 LightGBM 时)的性能与 DQN 和 DeepCFR 等成熟方法相当或更优,挑战了当前对神经网络在游戏 AI 中依赖的看法。 AI
影响 挑战了神经网络在游戏 AI 中的主导地位,并表明梯度提升树可以实现具有竞争力的或更优的性能。
排序理由 该项目是一篇研究论文,详细介绍了将梯度提升树应用于强化学习的新框架和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepCFR
- Flop5 Hold'em
- Goofspiel
- Kuhn's poker
- Leduc Hold'em
- Liar's Dice
- LightGBM
- Neural Networks
- Othello
- RL
- Tic-tac-toe
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →