一项对超过 31,000 个小时的大型语言模型 (LLM) 基准测试分数的新分析揭示了模型性能的显著差异。研究发现,日内分数波动平均为 2.8 分,而日间变化则大得多,平均为 8.4 分。这表明通过观察每日趋势而非每小时波动,可以更可靠地检测到持续的性能变化,因为日间变化大约是日内变化的 3 倍。该分析是使用 AIStupidLevel 进行的,这是一个由作者开发的用于持续 LLM 基准测试和漂移检测的开源系统。 AI
影响 强调了对 LLM 性能进行稳健、持续监控的必要性,以区分真实的漂移和正常的运行方差。
排序理由 LLM 基准测试分数和性能变化分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →