Meta 最新的基础模型 Muse Spark 1.2 在第三方性能分析中取得了高分,显示出自 Muse 系列发布四个月以来取得了快速进步。该模型在人工智能分析指数(Artificial Analysis Intelligence Index)上显著超越了 Grok 4.5,并在代理任务、编码和客户支持基准测试中展现出增强的能力。尽管其性能强劲且与竞争对手相比具有成本效益,但在某些高级基准测试中,Muse Spark 1.2 略微落后于 Claude Opus 5 和 GPT-5.6 Sol 等顶级模型。 AI
影响 为具有成本效益的 AI 性能设定了新的标杆,可能迫使竞争对手优化其模型的效率。
排序理由 Meta 发布了新的基础模型版本,并附带了基准性能数据。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
- AA-Omniscience Index
- Artificial Analysis Intelligence Index
- Claude Fable 5
- Claude Opus 5
- GDPval-AA v2
- GPT-5.5
- GPT-5.6 Sol
- Grok 4.5
- Humanity's Last Exam
- Kimi K3
- Meta
- Muse Spark 1.0
- Muse Spark 1.1
- Muse Spark 1.2
- SciCode
- SpaceXAI
- Terminal-Bench v2.1
- Vals AI
- Vals Index
- τ³-Banking
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →