DeepSeek 的 R1 模型于 2025 年 1 月发布,在 MMLU-Pro 和 GPQA 基准测试中取得了显著的成绩,分别达到了 84.4% 和 70.8%。然而,该模型的成本效益得到了强调,其“每美元智能点数”指标为 4.6,这表明它可能是用户的一个重要考虑因素。 AI
影响 该模型的性能和成本指标为评估模型效率的人工智能开发人员和研究人员提供了宝贵的数据。
排序理由 该条目报告了特定人工智能模型的基准分数,属于研究范畴。[lever_c_从研究降级:ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →