Llama 3.2 Instruct 90B (Vision) 的独立基准测试已发布,展示了其在多项关键评估中的性能指标。该模型在 GPQA 上 đạt 43.2%,在 MMLU-Pro 上 đạt 67.1%,在 Humanity's Last Exam 上 đạt 4.5%,在 LiveCodeBench 上 đạt 21.4%。这些结果是独立测量的,而非自我报告。 AI
影响 提供了 Llama 3.2 Instruct 90B 的独立性能数据,有助于模型选择和比较。
排序理由 开源模型的独立基准测试结果。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — sigmoid.social 阅读 →
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Humanity's Last Exam
- LiveCodeBench
- Llama~3.2
- MMLU-Pro
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →