OpenAI 声称其新的 GPT-5.6 Sol 模型在 ARC-AGI-3 基准测试上可以超越 Anthropic 的 Opus 5。然而,这一 38.3% 的优异分数是通过使用 OpenAI 的专有 API 功能实现的,包括保留推理和上下文压缩。在官方、提供商中立的 ARC-AGI-3 环境中进行测试时,GPT-5.6 Sol 的得分仅为 7.8%,而 Opus 5 在没有此类专门设置的情况下达到了 30.2%。 AI
影响 凸显了在大型语言模型公平和标准化基准测试方面持续存在的挑战。
排序理由 该集群报道了 OpenAI 关于模型在基准测试上表现的声明,但重点是围绕测试方法论的争议,而不是官方发布或研究论文。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →