chess
PulseAugur coverage of chess — every cluster mentioning chess across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
作者声称AI的数学突破使人类认可过时
一位AI研究人员认为,AI近期在数学上取得的突破,可能包括解决了纳维-斯托克斯方程等问题,代表了数学史上的一个巨大转变。作者认为,这些AI生成的证明极其复杂且数量庞大,以至于像菲尔兹奖这样的传统人类认可机制已过时。这一发展与过去AI在国际象棋和围棋等领域超越人类能力的情况类似,得出的结论是,人类在数学和其他科学领域的进步方面,可能不再与AI的智力相匹配。
-
新AI方法学习复杂博弈(如国际象棋)的可解释策略
研究人员开发了一种新方法,用于训练强化学习(RL)智能体将学到的策略合成为可执行程序,模仿人类理解复杂博弈策略的认知过程。该方法允许智能体学习和表示国际象棋等博弈以及网格环境任务的策略。所学策略已在博弈中证明有效,并且可以仅从博弈数据中获得。
-
普林斯顿研究人员训练40亿参数大语言模型掌握国际象棋并解释走法
普林斯顿的研究人员开发了一个拥有40亿参数的大语言模型,该模型在国际象棋中达到了2700 Elo评分。该模型展示了准确解释其走法的能力,并且在训练过程中未显示出性能平台期。研究团队认为,这种训练方法可以扩展到其他领域,包括机器人技术和通用计算机使用。
-
新基准评估AI代理从经验中自我改进的能力
开发了一个新的基准ServeLearnBench,用于评估AI代理从真实服务经验中改进的能力。该基准包括零售、银行和销售推介生成等领域的不断变化的环境和流式数据集,并在六种不同的语言大模型上测试了五种学习机制。初步研究结果表明,代理的任务能力与其从经验中学习的能力之间存在显著差距,持续适应的成本很高,并且经常会降低现有性能。探索不足被认为是有效适应的关键瓶颈。
-
新的大语言模型“Queen”以特级大师水平下棋并解释走法 · 追踪4个来源
研究人员开发了一个名为Queen的新颖框架,这是一个拥有40亿参数的语言模型,能够以特级大师水平下棋并解释其走法。该模型集成了静默专家国际象棋编码器和指令微调的语言模型,通过迭代训练来提高棋力及其解释的一致性。该方法使用了贝尔曼更新的自然语言类比,在Elo评分方面取得了显著的进步,并暗示了一种通用的方法,可以将语言模型应用于其他拥有可用专家编码器的领域,例如机器人和计算机使用。
-
用户批评YouTube AI搜索未能排除特定内容
一位用户对YouTube的AI搜索功能表示不满,因为它未能排除包含Magnus Carlsen的内容,尽管有明确的指示。用户搜索“请不要有Magnus Carlsen的国际象棋”的结果中,视频仍然突出显示Carlsen,导致用户对该平台的AI能力感到失望。用户将此与他们观看Stockfish对Leela或Gukesh比赛的偏好进行了对比。
-
小型人工智能模型在专业任务上优于通用模型
专业化的人工智能模型在特定任务上(例如下国际象棋)可以超越大型通用模型。LoRA 等技术可以有效地微调小型模型,使其在狭窄的领域内表现出色。这表明对于专业化应用,量身定制的人工智能解决方案通常比广泛的智能更有效。
-
国际象棋研究映射突显AI战略推理的差距
一篇新近发表在arXiv上的系统性映射研究,分析了关于战略推理的近期研究,重点关注国际象棋作为模型领域。该研究将研究分为人类棋手、传统国际象棋引擎、神经网络和大型语言模型(LLMs)几类。研究表明,虽然大多数研究集中在态势评估和行动选择上,但显式规划、解释和人机协作等领域仍未得到充分探索。该论文提出了在这些未充分探索领域的未来研究方向,并强调了国际象棋在弥合战略推理的认知和计算视角方面的潜力。
-
新的DART框架改进了用于复杂任务的循环推理模型
研究人员推出了一种名为分布对抗循环训练(DART)的新型框架,旨在增强循环推理模型(RRMs)的学习能力。DART通过使用目标分布围绕正确解,并利用对抗性目标来指导模型,从而用分布式监督取代实例级监督,解决了在复杂任务上训练RRMs的挑战。这种方法提供了更丰富的学习信号,促进了更稳定的迭代计算和更高的解质量。在迷宫、国际象棋和数独等问题上进行测试时,与标签平滑和渐进式训练等现有方法相比,DART表现出更强的鲁棒性和稳定性。
-
国际象棋策略为直观的AI编码实践提供见解
一篇文章探讨了国际象棋中的战略思维如何应用于“氛围编码”过程,这是一种更直观、结构化程度较低的软件开发方法。作者将国际象棋战术与编码中常用的创造性问题解决方式进行了类比,特别是在20世纪90年代AI开发经验的背景下。
-
研究发现 LLMs 在贝叶斯推理和信念更新方面存在困难 · 跟踪 4 个来源
近期研究表明,大型语言模型(LLMs)在一致地表示和更新概率信念方面存在困难,而这对于复杂领域中的决策至关重要。研究发现,LLMs 在处理证据时常常表现出内部不一致性,有时非贝叶斯启发式方法在下游任务中的表现优于精确的贝叶斯更新。这表明 LLMs 的内部世界模型可能被错误指定,导致认知短视和校准不当,尤其是在处理长尾事实或隐藏信息时。
-
人工智能利用强化学习发现高质量国际象棋谜题
研究人员开发了一种使用离线强化学习的方法,从包含15亿个解谜历史的大型数据集中发现高质量的国际象棋谜题。该方法旨在提高自动生成谜题的教学价值,因为这些谜题通常被认为不如人类专家精心挑选的谜题有效。该系统被证明能显著帮助初学者国际象棋玩家,特别是那些学习进展停滞不进的玩家,并通过专家玩家的定性分析得到验证。
-
专家预测AI将征服数学和理论物理学
一位AI专家预测,人工智能将很快掌握数学,超越人类的能力,因为它具有纯粹的逻辑性质,类似于国际象棋和围棋。该专家还预计AI将在理论物理学领域迅速发展,而与现实世界联系更紧密的领域将进展缓慢。
-
Claude Opus 4.8 的新颖国际象棋逻辑令用户惊讶
一位 Reddit 用户分享了他们使用 Claude Opus 4.8 的经历,对该模型在国际象棋的将死和逼和检测方面提出的创新但非传统的方法感到惊讶。该模型生成了一种暴力破解的解决方案,检查了每一个可能的棋子移动,然后验证国王是否仍然受到攻击。用户认为该模型能够处理双将和被钉住的棋子等复杂场景,这让他们“大开眼界”。
-
新框架提高了语言模型的推理质量和准确性
研究人员推出了一种名为可验证过程监督(VPS)的新型训练后框架,旨在提高语言模型的准确性和推理质量。与仅关注最终结果的传统强化学习方法不同,VPS监督结构化的中间声明,确保推理过程本身是可靠的。这种方法在国际象棋和数学推理等领域取得了显著改进,在保持预测准确性的同时,大大提高了模型逐步推理的可靠性和一致性。
-
国际象棋成为人工智能影响人类技能的比喻
作者以国际象棋为例,比喻人工智能可能如何影响人类技能和自我认知。历史上,国际象棋特级大师被视为天才,但随着人工智能的出现,他们的技能现在相当于听从机器的建议。这与“皇帝的新衣”的寓言相似,人们称赞一件不存在的衣服,以显得适合自己的地位。作者认为,人工智能可能会暴露其他领域类似的局限性,例如写作或研究,从而可能损害我们的自尊心。然而,重点应该是同情和善意,因为这些不可避免的变化正在展开,而不是羞耻或解雇。
-
宏观世界直觉:关注增长而非竞争
“宏观世界直觉”的概念描述了一种启发式方法,当个人或实体在一个大型、复杂的系统中运作,并且其行为对整体环境影响甚微时,这种方法是有效的。这些直觉表明,应专注于个人成长、价值创造和遵循一般原则,而不是仔细计算每个行动对他人造成的具体后果。例如,大型市场中的初创公司、小型交易者、早期游戏玩家以及资源丰富的物种,都受益于优先考虑自我发展和广泛原则而非即时、局部对抗性思维的策略。
-
研究发现,AI棋手在国际象棋中比人类维持更高的战略张力
一项新的研究论文分析了国际象棋中的战略决策,结果显示与顶尖人类特级大师相比,AI棋手能够维持更长时间的更高战略张力。这种张力是量化棋子之间相互作用的指标,在AI中随算法复杂度而扩展,在人类中则随技能线性扩展。研究结果表明,AI系统可以通过在更长时间内平衡攻防来管理更复杂、相互关联的局面,这与倾向于限制张力和复杂性的人类棋手形成对比。
-
2000年前中国棋盘游戏“六博”被发掘,象棋的先驱
中国考古学家发掘出一种名为“六博”的2000年前棋盘游戏,被认为是象棋的早期近亲。该游戏在西汉时期广受欢迎,在陕西省被发现,游戏包含两名玩家各操纵六枚棋子。尽管其确切规则在唐朝已失传,但历史学家推测它可能是中国象棋的前身,并可能受到围棋的影响。
-
Pippin Barr 的国际象棋变体和 Snap Store 维护安排
Pippin Barr 是一位实验性游戏开发者和大学教授,他发布了新的国际象棋变体,这些变体被认为很愚蠢,并且是对国际象棋尊严的侮辱。另外,Canonical 的 Snap Store 本周末计划进行数据库维护,届时将暂时无法进行安装和更新。