一项新的基准测试 Terminal-Bench 4.0 突显了顶级 AI 模型之间显著的成本差异,即使它们的性能得分几乎相同。GPT-6 Astra 通过 Codex 运行,得分 58.2%,完整运行成本约为 3,300 美元,而 Claude Fable 5.1 使用 Claude Code,得分 57.9%,但成本几乎翻倍,达到 6,200 美元。分析表明,开发者应将成本效益与性能并重,因为微小的分数差异可能不值得大幅提价,而像 Gemini 3.8 Flash 这样的模型则提供了与其成本相符的强大价值。 AI
影响 强调了在选择 LLM 时进行成本效益分析的关键需求,表明微小的性能提升可能不值得大幅增加价格。
排序理由 对一项具有详细成本效益数据的新基准测试的分析。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude Code
- Claude Fable 5.1
- codex
- Gemini 3.8 Flash
- GLM-5
- GPT-6 Astra
- Hermes Agent
- Nokka
- OpenAI
- Sonnet 5
- Tokencost
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →