QuantID 创建的一个新的实时仪表板将所有 48 项官方 Hugging Face 基准测试排行榜整合到一个视图中。该工具直接从 Hugging Face 的公共 API 聚合数据,展示参与模式和排名。值得注意的是,在 FINAL-Bench 组织下运营的韩国人工智能初创公司 VIDRAFT 目前在 48 项基准测试中的 10 项中处于领先地位,超越了所有其他组织。 AI
影响 提供了跨众多基准测试的人工智能模型性能的合并视图,有助于进行比较分析。
排序理由 该条目描述了一个用于现有排行榜的新可视化工具,而不是一个新的模型发布或研究突破。
- Alibaba Qwen
- Artificial Intelligence In Medical Epidemiology
- DeepSeek
- FINAL-Bench
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Hugging Face
- MMLU-Pro
- Moonshot AI
- SWE-bench
- VIDRAFT
- Zhipu AI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →