Hugging Face 维护着 48 个官方基准测试的排行榜,这些排行榜通过模型仓库中的 .eval_results YAML 文件由模型作者提交结果来填充。这些排行榜由 Hugging Face 自动组装,并非由基准测试所有者直接上传。大约 30% 的条目在默认视图中不可见,需要进行特定过滤。 “Agents and terminal”类别包含的基准测试最多,而 “Science and knowledge”类别包含的条目最多,其中 MMLU-Pro、GPQA Diamond 和 Humanity's Last Exam 是条目最多的基准测试之一。 AI
影响 提供了关于如何在各种基准测试中跟踪和比较 AI 模型性能的见解。
排序理由 文章详细介绍了 Hugging Face 基准测试排行榜的机制和数据结构,包括分数如何提交和显示。
- DeepSeek
- GPQA Diamond
- Hugging Face
- Humanity's Last Exam
- MMLU-Pro
- Moonshot AI
- Nvidia
- OpenAI
- Open ASR Leaderboard
- Ornithogalum
- Qwen
- SWE-bench Verified
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →