伯克利大学的一篇最新论文指出,人工智能领域普遍存在的“基准测试作弊”现象并非丑闻,而是现有激励机制下的可预测结果。该论文认为,在公开基准测试中获得高分的奖励(如资金和关注度)超过了操纵这些基准测试的成本,导致了持续的作弊循环。作者建议,这些基准测试应被视为进一步测试的先验条件,而非模型能力的决定性证据,因为模型性能的真正衡量标准在于其在特定、真实世界工作负载上的有效性。 AI
影响 强调了当前AI基准测试的不可靠性,并建议转向特定工作负载的测试。
排序理由 评论文章,讨论AI基准测试作弊的系统性问题。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →