截至 2026 年 10 月 4 日,Hugging Face 已正式认可 48 个数据集为基准测试,每个基准测试都有自己的排行榜。这些排行榜汇总了来自 95 个组织提交的约 410 个模型的测试结果。'Agents and terminal' 类别拥有最多的基准测试(17个),而 'Science and knowledge' 类别拥有最多的模型条目。这些排行榜的突出贡献者包括 Qwen、DeepSeek、Moonshot AI 和 OpenAI。 AI
影响 提供了跨各种基准测试的 AI 模型性能的综合视图,有助于进行比较分析。
排序理由 文章详细介绍了平台上官方基准测试的列表和参与度指标,而非新的模型发布或研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepSeek
- GPQA Diamond
- Hugging Face
- Humanity's Last Exam
- MMLU-Pro
- Moonshot AI
- Nvidia
- OpenAI
- Open ASR Leaderboard
- Ornithogalum
- Qwen
- SWE-bench Verified
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →