PulseAugur
实时 10:47:14
实体 Cue-GRPO

Cue-GRPO

PulseAugur coverage of Cue-GRPO — every cluster mentioning Cue-GRPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_183063 ·

    新的 GRPO 方法改进了 AI 模型在数学任务中的信用再分配

    研究人员开发了一种名为稀有度感知信用再分配用于 GRPO (GRPO) 的新方法,以解决具有可验证奖励的强化学习中的信用集中问题。该方法根据重复的正确解形式的稀有度来重新分配学习信号,防止常见解累积过多的正系数。该实现 Cue-GRPO 使用确定性策略提示来创建已验证正确的轨迹分区,在 Qwen2.5-Math-7B 和 Llama 3.1 8B-Instruct 等模型的竞赛数学任务上提高了性能,而训练开销却很小。