OpenAI 发布了其新模型 GPT-5.6 "Sol" 的性能声明,称其在 ARC-AGI-3 基准测试中超越了 Anthropic 的 Opus 5。然而,这些结果是在使用 OpenAI 专有 API 的情况下实现的,该 API 包括定制的推理和上下文压缩技术。在标准的 ARC-AGI-3 环境中进行测试时,GPT-5.6 "Sol" 的得分显著降低,而 Opus 5 在没有此类专业辅助的情况下取得了其分数。 AI
影响 此次基准测试比较突显了 AI 推理能力的潜在进步,尽管使用定制测试环境引发了关于直接可比性的疑问。
排序理由 该条目报告了新模型 GPT-5.6 "Sol" 的基准测试结果,并将其与竞争对手模型 Opus 5 在 ARC-AGI-3 基准测试上进行了比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →