最近对本地大语言模型竞技场的一次审计发现,一些模型,特别是 Gemma 和 Qwen,因“空响应”而被错误地扣分。这些模型实际上消耗了其全部响应限制用于内部思考过程,未能生成最终输出。此外,一个编码测试因僵化的解析器和令牌限制而出现问题,导致有效答案被拒绝。目前正在 Mac 上进行修复运行,仅重新运行所有五个模型受影响的任务,旨在产生修正后的排名。 AI
影响 修正了基准评分方法,确保对大语言模型推理能力的更公平评估。
排序理由 该项目详细说明了对大语言模型基准评估方法的修正。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →