对三款新的大型语言模型——谷歌的 Gemini 3.8 Flash、Anthropic 的 Claude Fable 5.1 和 OpenAI 的 GPT-5.6 Sol——的比较显示,在独立基准测试中,它们的性能相当,但价格差异显著。Gemini 3.8 Flash 的价格仅为另外两款模型的一小部分,但在人工智能分析智能指数(Artificial Analysis Intelligence Index)上得分相同。然而,Gemini 3.8 Flash 每个任务消耗的 token 更多,尽管其每个 token 的价格较低,但仍可能增加总体成本。这些模型在最大 token 输出量上也存在差异,Gemini 3.8 Flash 的容量是其他两款模型的一半,这可能会影响处理长文档任务的性能。 AI
影响 Gemini 3.8 Flash 提供了引人注目的成本效益比,可能会影响开发者的 API 选择,并推动 LLM 市场的竞争。
排序理由 在基准测试和定价方面对多个 LLM 模型进行比较。
- Anthropic
- Artificial Analysis
- Claude Fable 5.1
- Claude Opus 5
- Claude Sonnet 5
- Gemini 3.7 Flash
- Gemini 3.8 Flash
- GPT-5.6 Sol
- GPT-5.6 Terra
- Grok 4.6
- Muse Spark 1.2
- OpenAI
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →