OpenAI 详细介绍了特定的 API 设置如何显著影响基准性能,特别是对其 GPT-5.6 "Sol" 模型。通过 Responses API 启用 "保留推理" 和 "上下文压缩",GPT-5.6 Sol 在 ARC-AGI-3 基准测试中的分数提高了 188%,同时使用的输出 token 减少了六倍。OpenAI 认为,这些设置以及适当的框架设计和提示对于准确评估模型至关重要,尤其是在内存和上下文管理是关键的长期代理任务中。 AI
影响 强调了标准化评估实践和 API 配置对于准确衡量 AI 模型性能的重要性。
排序理由 OpenAI 正在解释其 API 设置如何影响基准结果,而不是宣布新模型或功能。
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →