PulseAugur
实时 07:21:11

新的ReCo方法改进了用于语言模型推理的GRPO

研究人员开发了ReCo,一种新颖的重加权方法,旨在改进语言模型中的Group Relative Policy Optimization (GRPO)。GRPO是一种标准的强化学习技术,但有时会因过度关注高概率响应而降低模型的推理能力。ReCo通过根据响应的预期发生次数进行归一化来处理响应贡献,并用基于方差的比例替换了token级别的importance ratio。这种方法旨在提高推理路径的覆盖率,尤其是在Pass@k等基准测试中k值较大时。 AI

影响 这项研究可能带来推理能力更强、潜在解决方案覆盖范围更广的语言模型。

排序理由 该集群包含一篇研究论文,详细介绍了一种改进语言模型强化学习的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ReCo方法改进了用于语言模型推理的GRPO

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim ·

    ReCo:重新加权GRPO以对抗分布集中

    arXiv:2607.26862v1 Announce Type: new Abstract: Group Relative Policy Optimization (GRPO) has become a standard reinforcement learning method for post-training language models. Recent work shows that GRPO can reduce the base model's reasoning capacity and underperform it in Pass@…