PulseAugur
实时 08:57:41
English(EN) OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 but only with its own custom test harness

OpenAI 声称 GPT-5.6 Sol 在 ARC-AGI-3 上以定制测试环境击败 Opus 5

OpenAI 发布了其新模型 GPT-5.6 "Sol" 的性能声明,称其在 ARC-AGI-3 基准测试中超越了 Anthropic 的 Opus 5。然而,这些结果是在使用 OpenAI 专有 API 的情况下实现的,该 API 包括定制的推理和上下文压缩技术。在标准的 ARC-AGI-3 环境中进行测试时,GPT-5.6 "Sol" 的得分显著降低,而 Opus 5 在没有此类专业辅助的情况下取得了其分数。 AI

影响 此次基准测试比较突显了 AI 推理能力的潜在进步,尽管使用定制测试环境引发了关于直接可比性的疑问。

排序理由 该条目报告了新模型 GPT-5.6 "Sol" 的基准测试结果,并将其与竞争对手模型 Opus 5 在 ARC-AGI-3 基准测试上进行了比较。[lever_c_demoted from research: ic=1 ai=1.0]

在 The Decoder 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

OpenAI 声称 GPT-5.6 Sol 在 ARC-AGI-3 上以定制测试环境击败 Opus 5

报道来源 [1]

  1. The Decoder TIER_1 English(EN) · Matthias Bastian ·

    OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 but only with its own custom test harness

    <p><img alt="" class="attachment-full size-full wp-post-image" height="768" src="https://the-decoder.com/wp-content/uploads/2026/06/openai_gpt56_sol.png" style="height: auto; margin-bottom: 10px;" width="1376" /></p> <p> OpenAI counters Anthropic's ARC-AGI-3 record: GPT-5.6 Sol s…