OpenAI 已证明,单个模型 GPT-5.6 "Sol",通过调整 API 设置而非更改模型本身,可以在 ARC-AGI-3 基准测试中实现显著的性能提升。通过保留模型的推理能力并压缩历史记录而非丢弃,该模型的分数从 13.3% 提高到 38.3%,同时使用的输出 token 减少了六分之一。这表明之前的基准测试结果可能由于配置选择而被人为降低,这些选择导致模型出现一种“顺行性遗忘”,迫使其逐轮重新推导解决方案。 AI
影响 强调了配置和提示工程在 LLM 性能中的关键作用,表明许多基准测试可能存在缺陷。
排序理由 该条目详细介绍了一种新颖的基准测试结果和模型配置分析,而非直接的模型发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →