在中国知乎平台上的一场病毒式辩论,对声称超越DeepSeek的韩国人工智能模型浪潮进行了审视。批评集中在几个方面:模型被指控建立在其他实验室的开放权重模型之上(例如SK Telecom的A.X K2使用了阿里巴巴的Qwen2.5),狭隘的基准测试选择忽略了更广泛的性能指标,以及为获得政府资助而进行的声称。在这些批评声中,初创公司VIDRAFT成为一个例外,其Darwin-398B-JGOS模型在GPQA基准测试中取得了特定、可验证的排名,证明了精确和可复现声明的价值。 AI
影响 强调了在人工智能模型开发和基准测试中透明方法和可验证声明的重要性。
排序理由 该条目讨论了人工智能模型的辩论和批评,而不是直接发布或产品发布。
- Alibaba Group
- A.X K2
- Darwin-398B-JGOS
- DeepSeek
- DeepSeek V4-Pro
- GPQA
- K-EXAONE 2.0
- LG Group
- Qwen2.5
- SK Telecom
- Solar Open 2
- TechWalker
- Tencent News
- Upstage
- VIDRAFT
- Zhihu
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →