一项名为 GoBench 的新基准测试已推出,旨在通过围棋游戏衡量通用推理能力。该基准测试显示,GPT-6 Astra 的 Elo 评分为 2568,高于 Sol (1929 Elo) 和 Opus 5 high (2076 Elo) 等其他模型。此外,当与编码能力集成时,GPT-6 Astra 的 Codex 变体达到了 3563 的 Elo,显著优于 Sol 的 Codex (2656 Elo)。 AI
影响 建立了一种新的 AI 推理评估方法,可能推动向更通用智能的发展。
排序理由 新基准测试的推出和 AI 模型的性能结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →