一款新的人工智能模型 GPT-5.6 Sol 已经达到了一个重要的里程碑,在 pass@5 的比率下达到了 ZeroBench 人类基线。这意味着在五次尝试中,至少有一次是正确的,表明其在复杂问题解决任务中表现强劲。该模型在不使用外部工具的情况下完成了这一成就,凸显了其固有的推理能力。 AI
影响 展示了先进的推理能力,可能为人工智能在复杂任务中的性能设定新的基准。
排序理由 前沿实验室模型发布,附带基准测试结果。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →