一项新的研究论文质疑了pass@k指标在评估AI模型方面的有效性,特别是在训练后微调之后。研究表明,虽然pass@k可能显示出边际改进,但它未能捕捉到输出多样性和能力保留等关键方面。使用Qwen2.5-1.5B-Instruct模型在数学问题上的实验显示,不同的微调方法导致多样性度量出现相反的趋势,但pass@k指标在硬问题覆盖率方面并未显示出明显的赢家或显著改进。该论文认为,pass@k可能具有误导性,尤其是在评估正确答案的多样性时,并建议当前的评估协议可能无法准确认证它们旨在衡量的属性。 AI
影响 强调了当前AI模型评估中潜在的缺陷,表明需要更强大的指标来捕捉多样性和真实的能力提升。
排序理由 分析AI模型评估指标的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →