DeepSeek V4 Pro 0813 在包括 Humanity's Last Exam、Long Context Reasoning 和 SciCode 在内的基准测试中展示了具体的性能指标。该模型在 Humanity's Last Exam 上达到 10.6%,在 Long Context Reasoning 上达到 50.7%,在 SciCode 上达到 39.9%。此外,它每秒处理 160.7 个 token,每美元达到 10.3 智能点,这些结果均经过独立测量。 AI
影响 提供了 DeepSeek V4 Pro 0813 模型在关键基准测试上的具体性能数据,有助于比较 AI 能力。
排序理由 该项目报告了 AI 模型的基准测试结果,属于研究范畴。[lever_c_research降级:ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →