Leduc Hold'em
PulseAugur coverage of Leduc Hold'em — every cluster mentioning Leduc Hold'em across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的 LUGL 框架使梯度提升树能够用于强化学习游戏
研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架允许将非增量学习器(如梯度提升树,GBT)有效地用于强化学习(RL)环境。这种方法将数据收集与模型拟合分离开来,使 GBT 能够克服通常阻碍其在 RL 中使用的分布偏移问题。LUGL 在有限表格中累积表格更新与使用该表格训练可泛化函数逼近器之间交替进行。在各种完全信息和不完全信息游戏中的实验表明,LUGL(特别是使用 LightGBM 时)的性能与 DQN 和 De…
-
新的CS-RNR方法允许AI智能体在游戏中自我认证其漏洞
研究人员开发了一种名为置信度调度受限响应(CS-RNR)的新方法,用于在不完美信息游戏中进行博弈的智能体。该技术允许智能体自我认证其漏洞,确保任何偏离纳什均衡策略的行为都经过安全审计。CS-RNR使用置信度序列来确定何时可以利用对手的行为,然后生成候选的应对策略。在Leduc扑克上的测试中,CS-RNR在保持安全保证的同时,取得了比以前的方法显著更高的收益。
-
新研究揭示了训练强大的轻量级游戏AI代理的关键技术
研究人员开发了一种稳健的方法,用于训练不完美信息纸牌游戏(如Gin Rummy和Leduc Hold'em)中的轻量级代理。通过使用一个固定的、强大的专家代理作为基准,他们确定了能够显著提高代理性能的关键训练技术。这些技术包括信任区域更新、有针对性的奖励、一系列难度递增的对手、预热启动以及保留最佳模型检查点。研究还发现,某些架构选择和训练方法(如学习状态嵌入、模仿学习以及使用大型语言模型作为对手)并无益处或计算成本过高。
-
StratFormer AI 学会博弈中的对手建模与利用
研究人员开发了 StratFormer,这是一种专为不完美信息博弈设计的新型 Transformer 代理。该代理通过两阶段训练课程来学习建模和利用对手的行为。StratFormer 在 Leduc Hold'em 中取得了成功,在对抗各种对手原型时,平均每手牌的利用收益为 0.106 个大盲注。