研究人员开发了 BehaviorTrace,这是一个用于评估在线强化学习(RL)中语言模型训练数据归因的开放评估工具。该研究在 Qwen2.5-1.5B 模型上使用 GRPO 进行,发现许多明显的归因信号实际上是混淆因素。一种简单的梯度幅度排序方法与目标估计器相比表现相当,模型流畅性也被证明是学习行为的有力预测指标。尽管每次部署的结果因种子和生成抽样而异,但出现了一个一致的信号:触发 token 的梯度与行为的实际发生一致。 AI
影响 强调了在强化学习模型中将学习行为归因于特定训练数据的局限性,表明需要更鲁棒的评估方法。
排序理由 研究论文,详细介绍了强化学习中归因方法的新评估工具。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →