PulseAugur
实时 10:41:32
English(EN) All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

新的ABC-GRPO算法增强了LLM训练的稳定性和性能

研究人员推出了一种名为全象限有界裁剪GRPO(ABC-GRPO)的新型算法,旨在提高大型语言模型(LLM)强化学习的稳定性和泛化能力。ABC-GRPO通过在似然比和优势空间的全部四个象限上应用无条件裁剪,解决了现有组相对策略优化(GRPO)方法中存在的无界盲点。这种新方法在使用Qwen3基础模型进行的数学推理任务上表现出卓越的性能,与GRPO、SAPO和双裁剪PPO相比,在Avg@64和Pass@64上取得了更高的分数,同时还保持了更高的熵。这些改进扩展到了MATH-500数据集以及HumanEval上的域外代码生成任务。 AI

影响 增强了LLM训练的稳定性和泛化能力,有望带来更强大、更具能力的AI系统。

排序理由 该集群包含一篇详细介绍LLM强化学习新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ABC-GRPO算法增强了LLM训练的稳定性和性能

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chi Liu, Xin Chen ·

    全象限有界裁剪GRPO:消除稳定和可泛化训练的无界盲点

    arXiv:2601.03895v2 Announce Type: replace-cross Abstract: Group Relative Policy Optimization (GRPO) has emerged as a popular algorithm for reinforcement learning with large language models (LLMs). However, GRPO inherits PPO's token-level clipping while replacing token-level advan…