独立基准测试揭示了两个大型语言模型 DeepSeek V4 Pro 和 Nova 2.0 Lite 的性能。DeepSeek V4 Pro 在侧重推理的任务中取得了高分,GPQA 得分为 92.8%,长上下文推理得分为 80.3%。Nova 2.0 Lite 被描述为非推理模型,在这些基准测试中的得分较低,但提供了更高的每美元智能点数指标。 AI
影响 为两个 LLM 提供比较性能数据,有助于为特定任务选择模型。
排序理由 两个 LLM 的独立基准测试结果已发布。
在 Mastodon — mastodon.social 阅读 →
- DeepSeek V4 Pro 0813
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Humanity's Last Exam
- SciCode
- DeepSeek V4 Pro
- Long Context Reasoning
- Nova 2.0 Lite
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →