根据独立测量结果,几款开源人工智能模型在各种基准测试中表现强劲。Mi:dm K 2.5 Pro 在 GPQA 上达到 70.1%,在 MMLU-Pro 上达到 80.9%;MiMo-V2-Flash 在 GPQA 上达到 83.5%,在 Humanity's Last Exam 上达到 20%;Qwen3.5 122B A10B 在 GPQA 上达到 85.7%,在 Humanity's Last Exam 上达到 23.4%;Apriel-v1.6-15B-Thinker 在 GPQA 上得分 73.3%,在 MMLU-Pro 上得分 79%。这些结果突显了开源大模型在不同评估指标上的能力正快速进步。 AI
影响 展示了开源大模型在各种基准测试中的能力取得重大进展,可能加速其采用。
排序理由 该集群报告了多款开源大模型的基准测试结果,数据来源于独立测量。
在 Mastodon — sigmoid.social 阅读 →
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Humanity's Last Exam
- long-context reasoning
- MiMo-V2-Flash
- SciCode
- Apriel-v1.6-15B-Thinker
- MMLU-Pro
- Mi:dm K 2.5 Pro
- Qwen3.5 122B A10B
AI 生成摘要 · Google Gemini · 来自 7 个来源。 我们如何撰写摘要 →