Anthropic 发布了 Sonnet 5.5,这是一个更快、更具成本效益的模型,旨在作为其 Opus 5.5 模型的补充。虽然 Sonnet 5.5 比其前代 Sonnet 5 有显著改进,但 Anthropic 自家基准测试表明,在需要持续判断的复杂、开放式任务上,Opus 5.5 仍然更胜一筹。关于 Sonnet 5.5 在 FrontierCode 基准测试上的表现出现了一个有趣的细节,即更高的努力程度导致分数降低,因为模型会进行广泛的代码审查过程,这种行为在 Opus 5 上也有观察到。 AI
影响 Sonnet 5.5 为日常任务提供了更易于使用的选项,而 Opus 5.5 在复杂推理方面继续保持领先地位,指导用户选择模型。
排序理由 Frontier-lab 模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- Anthropic
- Artificial Analysis
- Chartography
- Claude Code
- FrontierCode
- GPT-6 Sol
- Opus 5.5
- Sonnet 5
- Sonnet-5.5
- X
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →