对三款新大型语言模型——谷歌的 Gemini 3.8 Flash、Anthropic 的 Claude Fable 5.1 和 OpenAI 的 GPT-5.6 Sol——的比较显示,在独立基准测试中,它们的性能相当,但价格差异显著。Gemini 3.8 Flash 的价格仅为其他两款模型的一小部分,但在人工智能分析智能指数(Artificial Analysis Intelligence Index)上得分相同。然而,Gemini 3.8 Flash 每项任务消耗的 token 更多,尽管其每 token 价格较低,但仍可能增加总体成本。这些模型在最大 token 输出量上也存在差异,Gemini 3.8 Flash 的容量是其他两款模型的一半,这可能会影响处理长文档任务的性能。 AI
影响 Gemini 3.8 Flash 提供了引人注目的性价比,可能会影响开发者的 API 选择,并推动 LLM 市场的竞争。
排序理由 对多个 LLM 模型在基准测试和定价方面的比较。
- Anthropic
- Artificial Analysis
- Claude Fable 5.1
- Claude Opus 5
- Claude Sonnet 5
- Gemini 3.7 Flash
- Gemini 3.8 Flash
- GPT-5.6 Sol
- GPT-5.6 Terra
- Grok 4.6
- Muse Spark 1.2
- OpenAI
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →