研究人员开发了ReCo,一种新颖的重加权方法,旨在改进语言模型中的Group Relative Policy Optimization (GRPO)。GRPO是一种标准的强化学习技术,但有时会因过度关注高概率响应而降低模型的推理能力。ReCo通过根据响应的预期发生次数进行归一化来处理响应贡献,并用基于方差的比例替换了token级别的importance ratio。这种方法旨在提高推理路径的覆盖率,尤其是在Pass@k等基准测试中k值较大时。 AI
影响 这项研究可能带来推理能力更强、潜在解决方案覆盖范围更广的语言模型。
排序理由 该集群包含一篇研究论文,详细介绍了一种改进语言模型强化学习的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- DagsHub
- Group Relative Policy Optimization
- GRPO
- Hugging Face
- IArxiv
- Llama 3.1 8B-Instruct
- Qwen2.5-Math-1.5B
- Qwen2.5-Math-7B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →