GPT-6 Astra 在扩展的纽约时报连接基准测试中取得了 98.1 的新最高分,超越了之前的模型。一个变体 GPT-6 Astra (xhigh) 也获得了 97.7 的极高分数。与 GPT-5.6 Sol 相比,两个 GPT-6 Astra 模型都表现出卓越的性能,同时每个谜题的运行成本降低了约 40%。 AI
影响 在流行的基准测试中设定了新的性能标准,可能影响未来的模型开发和成本效益目标。
排序理由 模型的新基准分数。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →