一项比较基准测试在 18 项挑战性任务中对 Claude Opus 5 和 GPT-5.6 Luna/Sol 进行了测试,评估了准确性和指令遵循能力,而非速度。Claude Opus 5 的准确率为 17/18,而 GPT-5.6 Luna/Sol 的得分为 16/18。然而,具体的失败模式有所不同:Opus 5 有时会因包含额外文本而未能严格遵守 JSON 格式,而 GPT-5.6 Luna/Sol 的 Python 代码因不正确的自我测试而在导入时失败。 AI
影响 此基准测试突显了模型可靠性和指令遵循方面的细微差异,指导用户为特定任务(如严格的 JSON 输出或复杂的算法实现)选择模型。
排序理由 该集群报告了两个大型语言模型在特定任务上的基准比较,属于研究范畴。
AI 生成摘要 · Google Gemini · 来自 9 个来源。 我们如何撰写摘要 →