PulseAugur
实时 07:24:25
English(EN) The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and What Actually Works

研究发现:密集奖励导致 GRPO 训练的 LLM 智能体崩溃

研究人员发现,在使用密集预测奖励训练大型语言模型智能体时存在一个关键问题,尤其是在与 GRPO 算法结合使用时。这种旨在提供循序渐进监督的方法可能导致一种被称为“暗室”病理的现象,尽管预测准确率很高,但智能体却会进入任务成功率骤降的退化状态。研究发现,移除 GRPO 的组归一化可以解决这种灾难性的失败,这表明归一化会以一种破坏训练过程稳定的方式放大了组内方差。该研究提出了一个方差剖面标准来预测和避免此类崩溃,并指出辅助损失通道可能比奖励通道更有效地传递密集信号。 AI

影响 识别出 LLM 智能体训练中的一个关键失败模式,可能影响未来的强化学习方法。

排序理由 学术论文,详细介绍了 LLM 智能体训练中一种新颖的失败模式。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现:密集奖励导致 GRPO 训练的 LLM 智能体崩溃

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yu Wang ·

    奖励通道中的黑暗房间:密集预测奖励导致 GRPO 训练的 LLM 代理崩溃——以及真正有效的方法

    arXiv:2607.21273v1 Announce Type: new Abstract: Dense per-step supervision is an appealing remedy for sparse-reward, long-horizon LLM agents: reward the agent for predicting its next observation, and memory should follow. We show that under group-normalized RL (GRPO), this recipe…