Hugging Face 推出了一个新的交互式地图,整合了其 48 个官方基准测试,全面概述了 AI 模型在各个领域的性能。该地图显示,虽然与代理相关的基准测试数量最多,但由于实际考虑,科学和知识基准测试吸引了最多的提交。参与度不均衡,少数关键基准测试主导着排行榜条目,并且有相当一部分提交来自中国。 AI
影响 提供了 AI 模型性能的整合视图,帮助研究人员和开发人员了解基准测试格局和参与趋势。
排序理由 Hugging Face 推出了一个新的交互式地图/工具来可视化现有基准测试。
- AIME 2026
- GPQA Diamond
- Hugging Face
- Hugging Face Official Benchmarks: Map and Participation
- MMLU-Pro
- Open ASR Leaderboard
- SWE-bench
- SWE-bench Verified
- Terminal-Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →