PulseAugur
实时 04:10:22
实体 Dr. GRPO

Dr. GRPO

PulseAugur coverage of Dr. GRPO — every cluster mentioning Dr. GRPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_178755 ·

    统一的 RLVR 算法 GRPO、Dr. GRPO 和 DAPO 详解

    伊利诺伊大学厄巴纳-香槟分校 Bay 和 Yearick 的一篇新论文揭示,GRPO、Dr. GRPO 和 DAPO 在单一算法下得到统一,仅在处理组内奖励标准差(σ)方面有所不同。该论文提供了精确的公式来阐明每种变体何时最有效。GRPO 除以 σ 会放大简单和困难问题的梯度,而 Dr. GRPO 使用 σ 进行自然难度加权。DAPO 通过丢弃 σ 为零的批次来优化计算,这在困难问题中很常见。

  2. TOOL · CL_167621 ·

    新定理揭示大型语言模型策略优化中不可避免的权衡

    一篇新的研究论文建立了关于大型语言模型强化学习中策略优化不可能性定理。该论文证明,在标准结果奖励和组相对策略优化(GRPO)设置下,没有任何基于长度的加权方案能够同时实现无偏梯度估计和长度不变性。GRPO近似长度不变性但存在梯度偏差,而提出的改进方法Dr. GRPO实现了无偏梯度但引入了长度偏差,可能不成比例地影响较长的轨迹。

  3. TOOL · CL_132615 ·

    单个 Transformer 层训练在大型语言模型中可媲美完整的强化学习收益

    一项新的研究论文表明,训练单个 Transformer 层可以实现大部分,有时甚至超越大型语言模型中全参数强化学习(RL)适应的性能提升。这一发现挑战了普遍认为所有层在 RL 后训练中都做出同等贡献的假设。研究观察到,无论模型家族、RL 算法或任务领域如何,RL 收益高度集中在少数中间层,并且层排名在不同配置下保持一致。

  4. RESEARCH · CL_121414 ·

    研究发现:单个 Transformer 层训练可媲美完整的 RL 训练收益

    一项新研究表明,在大型语言模型中,训练单个 Transformer 层可以实现大部分,有时甚至超越完整参数强化学习(RL)的性能提升。研究人员通过引入“层贡献”指标来量化这一点,发现 RL 的收益高度集中在少数几层中,通常只有一层。无论模型家族、RL 算法或任务领域如何,这种现象都持续出现在 Transformer 堆栈的中间层。

  5. TOOL · CL_121137 ·

    新恒等式统一三种语言模型训练方法

    一篇新论文介绍了分组标准差恒等式(Group-Standard-Deviation Identity),证明了三种流行的语言模型训练方法——GRPO、Dr. GRPO 和 DAPO——本质上是对单个参数的调整:采样答案分歧的标准差。该恒等式揭示了标准差直接与训练更新的大小相关,一致同意不产生学习,而答案分歧则提供最重要的训练信号。研究通过 Big-Math 数据集和受控训练运行验证了这些发现,强调了该参数在决定学习效果和重点方面的关键作用。