对DeepSeek V4-Flash模型的最新分析显示,其在Terminal-Bench 2.1基准测试中声称的性能与独立验证结果之间存在显著差异。DeepSeek自己发布的图表显示得分为82.7,但Artificial Analysis的独立测量记录为79。这个3.7分的差异很大,特别是考虑到DeepSeek声称领先GLM-5.2仅1.7分。这种差异似乎源于DeepSeek在其基准测试中使用了一个未发布的内部框架DeepSeek Harness,这可能会夸大分数。 AI
影响 引发了对AI模型基准测试可靠性和测试方法透明度的质疑。
排序理由 文章分析并质疑了模型开发者发布的基准测试结果,而不是报道新的发布或研究发现。
- Artificial Analysis
- Claude Opus-4.8
- DeepSeek
- DeepSeek Harness
- DeepSeek-V4 Flash
- GLM-5.2
- Terminal-Bench 2.1
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →