Anthropic 的 Opus 5.5 近期的独立基准测试结果呈现出矛盾。Artificial Analysis 的一项评估将 Opus 5.5 置于总体第一的位置,在编码和知识测试中超越了 OpenAI 的 GPT-6 Astra 和 Anthropic 自家的 Fable 5.1。然而,Endor Labs 一项专注于安全代码生成的独立基准测试将 Opus 5.5 排在第三位,这表明它可能记住了训练数据,并且在真实项目的功能正确性方面存在困难。每项任务的成本也各不相同,尽管 Opus 5.5 的 token 成本较低,但 Astra 的成本更低。 AI
影响 Opus 5.5 喜忧参半的基准测试结果凸显了评估 LLM 能力(尤其是在安全编码和潜在数据记忆方面)的持续挑战。
排序理由 特定模型版本的独立基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
- Agent Security League
- Anthropic
- Artificial Analysis
- Endor Labs
- Fable 5.1
- GPT-6 Astra
- heise online
- OpenAI
- Opus 5.5
- SciCode
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →