在 MineBench.ai 上进行的最新基准测试揭示了 Anthropic 的 Claude Fable 5 和 Opus 5 模型之间存在显著差异。Opus 5 的推理时间显著延长,比 Fable 5 长 78%,运行成本也高出 64%。此外,Opus 5 生成的 JSON 输出平均比 Fable 5 大三倍。尽管存在这些性能上的不足,Opus 5 在生成的构建中对细节的关注令人印象深刻,正确地融入了曲面屏幕和室内地板等元素,而之前的模型未能做到这一点。 AI
影响 Opus 5 的详细输出表明其生成能力有所进步,但其效率低下也凸显了模型开发中持续存在的权衡。
排序理由 比较两个 AI 模型的基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →