研究人员发现,在使用密集预测奖励训练大型语言模型智能体时存在一个关键问题,尤其是在与 GRPO 算法结合使用时。这种旨在提供循序渐进监督的方法可能导致一种被称为“暗室”病理的现象,尽管预测准确率很高,但智能体却会进入任务成功率骤降的退化状态。研究发现,移除 GRPO 的组归一化可以解决这种灾难性的失败,这表明归一化会以一种破坏训练过程稳定的方式放大了组内方差。该研究提出了一个方差剖面标准来预测和避免此类崩溃,并指出辅助损失通道可能比奖励通道更有效地传递密集信号。 AI
影响 识别出 LLM 智能体训练中的一个关键失败模式,可能影响未来的强化学习方法。
排序理由 学术论文,详细介绍了 LLM 智能体训练中一种新颖的失败模式。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →