Claude Opus 5 在 SimpleBench 基准测试中取得了第二高的分数,仅以微弱差距落后于 Fable 5。该基准测试评估模型在时空推理、社交智能以及处理棘手问题的能力。Opus 5 的表现显著优于 Opus 4.6、4.7 和 4.8 等先前版本,以及在此特定评估中测试过的所有其他模型。 AI
影响 为推理和鲁棒性设定了新的性能基准,表明在高级 AI 能力方面取得了进展。
排序理由 该集群报告了 AI 模型的特定基准性能,属于研究范畴。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →