研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架使非增量学习器(如梯度提升树,GBT)能够在强化学习(RL)环境中发挥作用。传统上,神经网络在 RL 领域占据主导地位,因为它们能够处理自我对弈训练的非平稳性。然而,LUGL 将数据收集与模型拟合分离开来,使得 LightGBM 等 GBT 能够针对本质上是表格型的游戏状态进行训练。这种方法在用于累积游戏数据的本地更新和用于训练可泛化函数逼近器的全局学习阶段之间交替进行。在各种完美信息和不完美信息游戏中的实验表明,基于 LUGL 的智能体在与 DQN 和 DeepCFR 等既有方法相比时,取得了具有竞争力或更优的性能,挑战了当前对神经网络在游戏 AI 中依赖的看法。 AI
影响 挑战了神经网络在游戏 AI 中的主导地位,并表明梯度提升树可以取得具有竞争力或更优的性能。
排序理由 该条目描述了一个新的框架和实验结果,用于将梯度提升树应用于强化学习,并在研究论文中进行了介绍。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Connect 4x4
- DeepCFR
- Flop5 Hold'em
- Goofspiel
- Hugging Face
- Kuhn's poker
- Leduc Hold'em
- Liar's Dice
- LightGBM
- Neural Networks
- Othello
- Tic Tac Toe
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →