xAI 的 Grok 4.6 在同一基准测试中,根据测量方式的不同,表现得分差异巨大。根据 xAI 自家的 Terminal-Bench 3.0 模型卡,该模型得分为 26%,但 Artificial Analysis 的一项独立分析报告称,在基准测试的一个略有不同的版本上得分为 88.4%。这种差异凸显了在报告基准测试结果时限定条件的重要性。 AI
影响 强调了精确报告 AI 模型基准测试结果以避免误解性能的极端重要性。
排序理由 该条目讨论了 AI 模型的基准测试结果,属于研究范畴。[lever_c_research降级:ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →