OpenAI 宣布其 GPT-5.6 "Sol" 模型在 ARC-AGI-3 测试中取得了新的基准纪录,达到 38.3%。然而,这一结果是在使用专有环境的情况下获得的,并且在标准条件下,该模型的表现远不如 Opus 5。 AI
影响 这一基准测试结果凸显了标准化测试环境的重要性,并表明 GPT-5.6 "Sol" 在实际性能上可能尚未超越 Opus 5 等成熟模型。
排序理由 该项目报告了 AI 模型的基准测试结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →