一位用户在 25 项编码任务中对比了 Anthropic 的 Claude Opus 4.8 和 Opus 5,发现两个模型都达到了 9/25 的严格测试通过率。Opus 5 展现了更广泛的搜索和验证,使用了更多的命令和修订,而 Opus 4.8 则保持了较小的代码占用空间。尽管方法不同,成本和性能指标保持相似,Opus 5 价格稍低,但使用了更多的 token 和时间。 AI
影响 Opus 5 更广泛的搜索策略可能为复杂的编码任务提供新的方法,尽管其实际效用仍与 Opus 4.8 相当。
排序理由 用户对两个模型版本的对比,并非主要发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →