对 162 个 AI 模型基准测试比较的最新分析显示,数据透明度和可复现性存在严重问题。在来自六个 AI 模型发布帖子的 44 个比较中,只有 11 个可以独立验证,而另外 28 个则缺乏足够的数据进行诚实评估。同样,在 118 个排行榜比较中,只有 9 个可以清晰区分。研究强调,尽管基准测试分数可能看起来很精确,但底层数据通常不允许独立验证,这引发了对报告性能差异可靠性的担忧。 AI
影响 由于基准测试中数据透明度不足,凸显了对报告的 AI 模型性能可靠性的担忧。
排序理由 对 AI 基准测试数据透明度和可复现性的分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →