对 LLM 评估套件的分析显示,其大部分测试用例随着时间的推移已变得无效。在具有足够版本历史的 528 个案例中,有 356 个在所有测试版本中始终通过,59 个始终失败,表明它们没有提供区分能力。只有 113 个案例(占判断集的 21%)在不同版本之间确实存在差异,这表明随着错误的修复且未重新引入,该套件检测回归的能力已经减弱。 AI
影响 凸显了为快速发展的 LLM 维护有效评估套件的挑战。
排序理由 对 LLM 评估套件历史性能的分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →