研究人员推出了一种名为全象限有界裁剪GRPO(ABC-GRPO)的新型算法,旨在提高大型语言模型(LLM)强化学习的稳定性和泛化能力。ABC-GRPO通过在似然比和优势空间的全部四个象限上应用无条件裁剪,解决了现有组相对策略优化(GRPO)方法中存在的无界盲点。这种新方法在使用Qwen3基础模型进行的数学推理任务上表现出卓越的性能,与GRPO、SAPO和双裁剪PPO相比,在Avg@64和Pass@64上取得了更高的分数,同时还保持了更高的熵。这些改进扩展到了MATH-500数据集以及HumanEval上的域外代码生成任务。 AI
影响 增强了LLM训练的稳定性和泛化能力,有望带来更强大、更具能力的AI系统。
排序理由 该集群包含一篇详细介绍LLM强化学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- ABC-GRPO
- All-Quadrant Bounded Clipping GRPO
- Chi Liu
- dual-clip PPO
- Group Relative Policy Optimization
- GRPO
- HumanEval
- MATH-500
- Proximal Policy Optimization
- Qwen3
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →