一项新的分析显示,仅结果强化学习(RLVR),也称为 GRPO,会损害 AI 模型的基础能力,尤其是在搜索增强任务中,而标准的贪婪准确性指标无法检测到这一点。研究人员开发了一个受控系统来研究这种故障模式,发现虽然贪婪准确性可能看起来有所提高或保持稳定,但模型执行复杂任务的能力可能会大大降低。该研究表明,评估者应纳入 pass@k 等基于采样的指标来检测这些隐藏的退化,因为如果基础模型的能力已被侵蚀,测试时搜索可能不是可靠的后备方案。 AI
影响 强调了常见 AI 评估指标中的一个关键缺陷,表明需要更强大的测试来防止已部署模型中隐藏的能力退化。
排序理由 该项目描述了对 AI 训练方法中特定故障模式的新分析和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →