AlphaZero
PulseAugur coverage of AlphaZero — every cluster mentioning AlphaZero across labs, papers, and developer communities, ranked by signal.
- developed by Google DeepMind 100%
- instance of DagsHub 90%
- founded David Silver 90%
- founded Ineffable Intelligence 90%
- developed ScienceCast 90%
- used by Monte Carlo tree search 70%
- employed by David Silver 70%
- affiliated with Ineffable Intelligence 70%
- instance of Gotit.pub 70%
- instance of alphaXiv 70%
- developed by Monte Carlo tree search 50%
- instance of ScienceCast 50%
2 天有情绪数据
-
OpenAI 研究员详解多智能体系统,强调模型实力
OpenAI 研究员 Noam Brown 讨论了多智能体系统的发展和影响,并将其与测试时计算的扩展进行了类比。他解释说,虽然大型语言模型从增加推理时间中获益匪浅,但多智能体系统通过并行化提供了一种实现这一点的方法。Brown 强调,最近在解决千禧年大奖难题方面取得的成功,主要归功于底层模型本身的实力,而多智能体系统贡献了一小部分,尽管是新颖的。他还详细介绍了 OpenAI 在多智能体系统方面的做法,该做法强调最少的脚手架,并允许智能…
-
AI研究探索具身智能体和游戏开发的自我对弈 · 追踪6个来源
两篇新研究论文探讨了用于AI开发的先进自我对弈技术。一篇论文介绍了用于具身智能体的游戏引导技能发现(GGSD),通过竞争性游戏实现人类可玩的操作技能。另一篇提出了RSIGame,一个用于自主智能体游戏开发的框架,该框架使用递归自我改进来提高游戏质量和效率,在某些基准测试中显著优于GPT-5.5。
-
近似价值迭代在AI游戏对弈中被证明具有惊人的有效性
一篇新的研究论文探讨了近似价值迭代(AVI)在游戏程序自我对弈中的有效性。与预期相反,AVI 展现出了惊人的有效性,学习到的价值函数比 AlphaZero 更准确,并以显著更低的计算成本保持了有竞争力的策略。研究表明,尽管像 AVI 这样的简单方法随着现代深度学习工具的实用性日益增强,但它们可能被蒙上了阴影,而像蒙特卡洛树搜索(MCTS)这样的复杂方法则更受关注。
-
新型流网络应对随机和对抗性AI挑战
研究人员推出了期望流网络(EFlowNets),这是生成流网络(GFlowNets)的改进版本,旨在在随机环境中有效运行。与现有的GFlowNet模型相比,EFlowNets在蛋白质设计等任务中表现出更优越的性能。在此基础上,研究人员开发了用于双人零和博弈的对抗流网络(AFlowNets),结果表明AFlowNets通过自我对弈可以识别出Connect-4中超过80%的最优走法,并在竞技比赛中超越AlphaZero。
-
新的探索方法提升无搜索象棋AI实力
研究人员开发了一种名为先验引导探索的新方法,用于无搜索象棋引擎,旨在提高其超越简单模仿更强玩家的表现。该技术用前向Kullback-Leibler散度取代了标准的熵奖励,该散度将探索引导至网络自身搜索先验所识别的有希望的走法。该方法还结合了基于结果不确定性的自适应采样温度,从而提高了自我对弈强化学习中的战术准确性和博弈能力。
-
AI 方法通过 98.43% 的生存率提升电网稳定性
研究人员开发了一种受 AlphaZero 启发的蒙特卡洛树搜索 (MCTS) 方法,用于电力网络的自主拓扑控制。该方法旨在管理拥堵并维持电网稳定,尤其是在可再生能源整合日益增加的情况下。研究发现,优化的 AlphaZero 方法达到了 98.43% 的峰值生存率,优于近端策略优化 (PPO) 变体。关键发现表明,使用简单的二元生存奖励和受限的线路负荷观测空间,在没有先验策略或价值函数指导的情况下,可以提高训练效率和有效性。
-
研究发现 AlphaZero 的学习行为得到部分内化
一项新的研究论文探讨了 AlphaZero 如何内化在自我对弈搜索中学到的行为。研究人员使用一种称为跨阶段先验干预(CPI)的方法,可以在评估期间区分网络学到的行为和搜索算法提供的行为。研究发现,虽然搜索指导显著提高了性能,但即使在移除指导后,网络仍保留了相当一部分这些学习到的行为,尽管这种内化的能力受限于几何形状,在新的情况下的效果较差。
-
新AI架构在消费级硬件上提升围棋表现
研究人员开发了一种新的围棋AI信念引导架构,旨在提高在消费级硬件上的性能。该架构将策略头与一个独立的信念头分开,后者模拟认知不确定性和战略稳定性。通过引入记忆机制和门控机制来过滤过度自信的策略错误,该模型将智能从运行时搜索转移到参数化直觉,显著提高了无搜索胜率并减少了幻觉。
-
英伟达的开源推动获得关注,但Anthropic仍是例外
英伟达CEO黄仁勋发起了一项开源倡议,获得了包括OpenAI和Microsoft在内的70多家公司和组织的支持。然而,Anthropic却显著未签署该倡议,一位Anthropic员工公开质疑此次开源推动的诚意,并暗示英伟达自身的闭源实践,如CUDA和GPU驱动程序,也应开源。此次交流引发了关于开源倡导背后真实意图及其对AI生态系统的潜在影响的辩论,尤其是在硬件依赖方面。
-
Matilda AI 通过人类策略指导增强国际象棋引擎
研究人员推出 Matilda,一种新颖的 AI 模型,旨在通过整合人类策略指导来增强国际象棋引擎的性能。该模型是一种排列不变的集合 Transformer,重新对 Maia-3 策略建议的走法进行排序,提高了其模拟高水平人类对弈和个体对弈风格的能力。Matilda 整合了来自 Maia-3 隐藏表示、时间控制和玩家风格向量的上下文,并可选择由 Stockfish 或 AlphaZero 等引擎进行重新评分,在更强玩家的准确性方面取得了显著的提升。
-
AI智能体“WallZero”精通复杂棋盘游戏WallGo
研究人员开发了基于AlphaZero的AI智能体WallZero,旨在精通策略棋盘游戏WallGo。这款游戏因一部Netflix剧集而流行,尽管棋盘尺寸不大,但复杂度很高。WallZero通过击败两名专业围棋选手展现了卓越的性能,平均每局多获得1.98倍的领土。该研究还利用WallZero分析了游戏的公平性并识别了最优策略,发现Netflix剧集中出现的开局能带来更平衡的对局。
-
AI发现更优的格约简策略,超越LLL算法
研究人员开发了一种深度强化学习方法来发现新的格基约简策略,其性能优于传统的Lenstra-Lenstra-Lovász (LLL)算法。通过将格约简构建为马尔可夫决策过程,并采用类似AlphaZero的、带有蒙特卡洛树搜索的自我博弈流程,该系统(命名为DeltaStar)学会了以更少的操作实现更好的约简。值得注意的是,DeltaStar在无需重新训练的情况下,能够有效地泛化到更高维度和未见的模。
-
AI发现更优的格规约策略,超越LLL算法
研究人员开发了一种新的方法,使用深度强化学习来发现更优的Lenstra-Lenstra-Lovász (LLL)算法策略,LLL算法是计算机科学中格基规约的基本工具。通过将格规约视为马尔可夫决策过程,并采用类似AlphaZero的自我博弈流程结合蒙特卡洛树搜索,他们训练了一个名为DeltaStar的策略。这种使用低维格开发的新策略比传统的LLL算法需要更少的操作,并且在无需重新训练的情况下,能够零样本泛化到更高维度和未见的模。
-
David Silver 的 Ineffable Intelligence 公司以反LLM赌注融资110亿美元
Ineffable Intelligence 是一家成立仅两个月、由 DeepMind 的 David Silver 创立的公司,已获得创纪录的110亿美元种子轮融资,估值达到510亿美元。该公司的核心赌注挑战了主流的LLM范式,认为真正的AI发展在于与环境互动并从结果中学习,而不仅仅是处理静态的人类文本数据。来自 Sequoia、Lightspeed、Google 和 NVIDIA 等主要参与者的巨额投资表明,业内对当前AI“规模至…
-
AlphaZero 奥赛罗训练困境促使超参数分析
一位用户正在为 6x6 版奥赛罗训练 AlphaZero 模型,但遇到了性能问题。尽管模型之间相互改进,但它们并不比基准代理显著更好,对贪婪代理的胜率低于 10%。用户已经分析了训练数据,包括价值损失、预测熵和策略分歧,并正在寻求关于超参数调整的建议,以解决模型的糟糕性能。
-
机制可解释性揭示大型语言模型的推理过程
研究人员正通过机制可解释性在理解大型语言模型的内部运作方面取得重大进展。诸如Anthropic的电路追踪等技术能够识别模型前向传播中的高级概念及其因果关系。这种方法揭示了大型语言模型会进行多步推理并开发独特的算法,表明其存在一种与人类认知不同的“潜意识”处理形式。
-
开发者开始MCP实习,瞄准潜在论文
一位开发者在新岗位上专注于模型上下文协议(MCP),目标是将其与大型语言模型(LLMs)和自定义模拟器集成。这项工作有潜力发表一篇论文。该开发者还在为Kaggle Orbit Wars竞赛开发一个基线策略。
-
Google 停用 Gemini CLI;AlphaZero 击败 Stockfish
Google 将于 6 月 18 日停用其 Gemini CLI 工具,并敦促用户迁移到 Anti Gravity CLI。另外,DeepMind 的 AlphaZero 在经过大量训练后,以零败绩击败 Stockfish,展示了其显著的国际象棋对弈能力。
-
新AI方法应对不完美信息游戏
研究人员正在开发新的方法来应对具有不完美信息(imperfect information)的复杂游戏。一篇论文介绍了循环结构策略梯度(Recurrent Structural Policy Gradient, RSPG),这是一种用于部分可观察平均场博弈(partially observable mean field games)的新颖方法,其收敛速度比现有方法更快。另一项研究重新评估了策略梯度方法,发现像PPO这样更简单的算法可以与…
-
RL框架在Tamarin中自动化安全协议分析
研究人员开发了一个强化学习(RL)框架,以自动化和缩短使用Tamarin工具分析安全协议的过程。这种受AlphaZero启发的创新方法采用神经启发式来指导蒙特卡洛树搜索,并从已完成的子证明中学习。在16个案例研究上的评估表明,与现有方法相比,RL方法能够自动找到更多证明并生成更短的证明,从而显著减少了协议验证所需的人工努力。