PulseAugur
中
实时 09:01:06
实体 Othello

Othello

PulseAugur coverage of Othello — every cluster mentioning Othello across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. COMMENTARY · CL_255851 ·

    人工智能在隐晦填字游戏中挣扎,尽管存在生存威胁

    根据《卫报》的一系列读者来信,尽管人工智能有可能控制互联网,但它在解决隐晦填字游戏等复杂任务方面却举步维艰。一封来信指出,虽然人工智能可能强大到足以

  2. TOOL · CL_244895 ·

    近似价值迭代在AI游戏对弈中被证明具有惊人的有效性

    一篇新的研究论文探讨了近似价值迭代(AVI)在游戏程序自我对弈中的有效性。与预期相反,AVI 展现出了惊人的有效性,学习到的价值函数比 AlphaZero 更准确,并以显著更低的计算成本保持了有竞争力的策略。研究表明,尽管像 AVI 这样的简单方法随着现代深度学习工具的实用性日益增强,但它们可能被蒙上了阴影,而像蒙特卡洛树搜索(MCTS)这样的复杂方法则更受关注。

  3. TOOL · CL_235447 ·

    新的 LUGL 框架使梯度提升树能够用于强化学习游戏

    研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架允许将非增量学习器(如梯度提升树,GBT)有效地用于强化学习(RL)环境。这种方法将数据收集与模型拟合分离开来,使 GBT 能够克服通常阻碍其在 RL 中使用的分布偏移问题。LUGL 在有限表格中累积表格更新与使用该表格训练可泛化函数逼近器之间交替进行。在各种完全信息和不完全信息游戏中的实验表明,LUGL(特别是使用 LightGBM 时)的性能与 DQN 和 De…

  4. TOOL · CL_239999 ·

    新的 LUGL 框架使梯度提升树能够用于强化学习游戏

    研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架使非增量学习器(如梯度提升树,GBT)能够在强化学习(RL)环境中发挥作用。传统上,神经网络在 RL 领域占据主导地位,因为它们能够处理自我对弈训练的非平稳性。然而,LUGL 将数据收集与模型拟合分离开来,使得 LightGBM 等 GBT 能够针对本质上是表格型的游戏状态进行训练。这种方法在用于累积游戏数据的本地更新和用于训练可泛化函数逼近器的全局学习阶段之间交替…

  5. TOOL · CL_105033 ·

    新GARIP方法增强零和博弈中自博弈的收敛性

    研究人员推出了一种新颖的用于改进双人零和博弈中自博弈的方法,名为GARIP。与使用固定或定期更新参考的方法不同,GARIP利用过去策略的运行平均值。该方法在理论上被证明可以最小化参考值的峰值滞后,从而实现更稳定的收敛。在包括矩阵博弈以及Connect Four和Othello等棋盘博弈在内的各种博弈上的实验表明,GARIP在鲁棒性和默认超参数设置方面,表现与现有方法相当或更优。

  6. TOOL · CL_69336 ·

    AlphaZero 奥赛罗训练困境促使超参数分析

    一位用户正在为 6x6 版奥赛罗训练 AlphaZero 模型,但遇到了性能问题。尽管模型之间相互改进,但它们并不比基准代理显著更好,对贪婪代理的胜率低于 10%。用户已经分析了训练数据,包括价值损失、预测熵和策略分歧,并正在寻求关于超参数调整的建议,以解决模型的糟糕性能。