DeepSeek 正在淘汰其旗舰模型 DeepSeek V4-Pro,将所有请求转至其 V4.1-Flash 变体。此决定是在内部和外部测试表明 V4.1-Flash 在能力、成本和速度方面优于 V4-Pro,甚至在 Terminal-Bench 2.1 等基准测试中超越了 Claude Opus 5 和 GPT 5.6 "Sol" 等模型之后做出的。然而,V4.1-Flash 模型在事实问答方面表现出回归,SimpleQA 分数显著下降,这表明在代理性能和世界知识之间存在权衡。 AI
影响 此举标志着行业可能朝着优先考虑成本效益和速度转变,即使以牺牲部分事实回忆为代价,从而影响未来的模型开发和定价策略。
排序理由 DeepSeek 是一个前沿实验室,这是对其旗舰模型产品的一次重大改变,实际上是淘汰了一个并推广了另一个。
- Claude Opus 5
- DeepSeek
- DeepSeek V4-Pro
- GLM 5.3
- GPT 5.6 "Sol"
- Hermes Agent
- K2.7 Code
- Kimi k3
- Moonshot
- Opus 4.8
- SimpleQA
- Terminal-Bench 2.1
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →