DeepSeek-V2.5 定于 2024 年 12 月发布,在 MATH-500 基准上取得了 76.3% 的分数。这一性能指标经过了独立验证,区别于新闻稿中常见的自报数据。结果可在公共排行榜上与其他模型进行比较。 AI
影响 独立验证的基准结果为模型能力提供了更清晰的图景,有助于客观比较。
排序理由 即将发布的模型的独立基准结果。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →