Mistral Large 4 在编码任务的 DeepSWE v1.1 基准测试中取得了 61.7% 的性能。这一分数使其落后于中国开放权重模型(约 69%)以及来自 OpenAI、Google 和 Anthropic 的领先闭源模型(约 74%)。数据显示,即使开放权重模型的发展和可用性不断提高,性能差距依然存在。 AI
影响 Mistral Large 4 在编码基准测试中的表现表明,与领先的闭源模型和部分开放权重模型相比,仍有改进空间。
排序理由 该条目报告了特定 AI 模型的基准测试结果,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →