Mistral Medium 3 在多项基准测试中表现出色,在 GPQA 上达到 57.8%,在 MMLU-Pro 上达到 76%。该模型在 Humanity's Last Exam 上得分 4.1%,在 Long Context Reasoning 上得分 31.7%。值得注意的是,它每美元提供 15.6 智能点,表明其具有成本效益。 AI
影响 提供了 Mistral Medium 3 的性能指标,有助于比较 AI 模型的能力和成本效益。
排序理由 该项目报告了 AI 模型的基准测试结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Humanity's Last Exam
- long-context reasoning
- Mistral Medium 3
- MMLU-Pro
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →