Grpo
PulseAugur coverage of Grpo — every cluster mentioning Grpo across labs, papers, and developer communities, ranked by signal.
- developed by Language Models 95%
- used by Influence Flower 90%
- developed CatalyzeX Code Finder for Papers 90%
- developed Gepa Ai Agent 90%
- developed IArxiv 90%
- used by Direct Preference Optimization 90%
- authored by Dr. GRPO 90%
- developed Artificial Intelligence In Medical Epidemiology 90%
- instance of Dr. GRPO 90%
- developed by Influence Flower 70%
- instance of Direct Preference Optimization 70%
- developed by CatalyzeX Code Finder for Papers 70%
- 2026-07-09 research_milestone Researchers published a paper detailing the GRPO method for improving synthetic speech ASR. 来源
20 天有情绪数据
GRPO and its variants (HölderPO, GROW) are central to recent LLM policy optimization research
Multiple recent clusters highlight GRPO and its derivatives (HölderPO, GROW) as key advancements in LLM policy optimization. This indicates a strong research trend focusing on refining reinforcement learning techniques for LLMs, particularly in areas like multi-agent interaction, handling complex reward structures, and improving stability and adaptability in diverse tasks.
GROW framework to see adoption for VLM agent development beyond Minecraft
The GROW framework, leveraging adapted GRPO, has shown state-of-the-art performance on over 800 Minecraft tasks for VLM agents. This success in a complex, open-world environment suggests potential for broader application in other VLM agent development scenarios, such as robotics, simulation, or other interactive environments where multi-turn learning and handling long contexts are critical.
GRPO to be integrated into Anyscale's LLM post-training automation
The recent Anyscale Agent Skill launch focuses on automating LLM post-training runs, while another cluster details GRPO's use in multi-agent LLM deferral to humans. Given GRPO's demonstrated ability to incorporate human expertise and Anyscale's push for automation, it's plausible GRPO will be integrated as a method within Anyscale's automated post-training workflows to enhance human-in-the-loop capabilities.
GRPO,或称组相对策略优化,是一种关键的强化学习算法,通过优化基于组平均奖励的策略来改进LLM训练。它是PPO的一个变体,去除了计算成本高昂的Critic网络,转而使用奖励模型对多个采样输出来评分。这种方法在增加生成时间的同时,减少了内存和计算负担,使其能够高效地处理各种复杂任务。GRPO经常被用于增强LLM的推理能力,新的方法如Goldilocks RL和APIVIS利用它来实现更快、更准确的训练。例如,Goldilocks RL使用具有GRPO的自适应数据选择策略,将推理任务的训练时间缩短高达78%。同样,APIVIS将Gumbel搜索集成到RLVR中,通过多样化训练的展开来提高数学推理能力并维持学习信号。最近的研究引入了CorrGRPO和GRAFT等创新方法来解决GRPO的局限性,特别是在多奖励学习和有限的展开预算方面。CorrGRPO对成对协方差进行归一化,以防止大奖励掩盖小奖励,从而改进代码生成等任务中的多奖励学习。GRAFT允许异构模型交换成功的轨迹,在有限的展开可能无法提供策略梯度信号的情况下提高性能。GRPO的用途已扩展到物理智能、晶体结构发现甚至人类行为模拟等不同领域。GroundingPI是一个物理智能模型,展示了GRPO在机器人操作和自动驾驶中的有效性。ANCHOR使用GRPO组合策略进行从头开始的晶体生成,显著提高了新结构的发现率。此外,macro2mind使用类似GRPO的方法来训练LLM,以从预测市场数据中模拟个体人类行为。GRPO是强化学习的一个基准,经常与其他方法如PPO、RLCD和AC2进行比较和集成以进行性能评估。研究表明,RLCD在推理模型校准方面优于GRPO,而AC2在训练LLM方面效率更高。然而,GRPO通常作为一个强大的基线,新的算法如“Follow the Winners”在代理LLM的无Critic强化微调中取得了可比的性能。
近期动态
- — 研究发现AI模型在看不见的任务上陷入“泛化陷阱”
- — 新的Goldilocks RL方法大幅缩短语言模型推理的训练时间
- — 新研究解释了GRPO归一化在自适应梯度中的作用
- — 新的ANCHOR方法增强了晶体结构的发现
- — 新的CorrGRPO方法增强了语言模型的多奖励学习
- — GRPO算法变体阐明了其在RL微调中的作用
为何这些故事上榜
-
95
This cluster highlights a critical challenge for GRPO-like models, showing how training metrics can be misleading for generalization. Its high ranking reflects the importance of understanding these limitations.
-
90
This cluster introduces a new method, RLCD, that surpasses GRPO in reasoning model calibration. Its strong performance against GRPO makes it a notable development in the field.
-
80
This cluster details Goldilocks RL, a method that significantly improves GRPO's efficiency for reasoning tasks. The substantial reduction in training steps makes it a high-impact story.
-
75
This cluster provides theoretical backing for GRPO's normalization, explaining its role as an adaptive gradient. Such foundational research is crucial for understanding the algorithm's mechanics.
-
65
The introduction of CorrGRPO addresses a key limitation of standard GRPO in multi-reward learning. This advancement improves GRPO's applicability in complex, multi-objective scenarios.
-
60
This foundational cluster clarifies GRPO's core mechanism as a PPO variant without a critic network. Its importance lies in defining the algorithm's unique approach to RL fine-tuning.
Grpo报道走势
趋势
Coverage of GRPO is currently accelerating, particularly with a surge of research papers in early October 2026. Many clusters (e.g., 283782, 273147, 280259) detail new methods that either build upon, compare against, or directly improve GRPO. This indicates active development and scrutiny of the algorithm.
与同行对比
GRPO is frequently benchmarked against other reinforcement learning methods like PPO, RLCD, and AC2. While some new methods claim to surpass GRPO in specific metrics (e.g., RLCD in calibration, AC2 in training speed), GRPO consistently serves as a strong baseline. Its unique critic-free approach distinguishes it from standard PPO, offering efficiency benefits that peers might not.
话题分布
This cycle, the topic mix for GRPO has heavily shifted towards paper/model_release and product (new methods/frameworks). There's a strong emphasis on improving reasoning capabilities and efficiency (e.g., Goldilocks RL, AC2). Applications in physical intelligence and crystal discovery also represent a new thematic expansion.
编辑观点
We observe a vibrant research landscape around GRPO, solidifying its role as a foundational, yet evolving, reinforcement learning algorithm. The sheer volume of recent papers either building upon or comparing against GRPO underscores its significance in LLM fine-tuning. While new methods are emerging to address its limitations, GRPO's core efficiency and adaptability continue to drive innovation across diverse AI applications.
常见问题
- GRPO算法在AI中的主要目的是什么?
- GRPO算法,或称组相对策略优化,主要用于通过强化学习来微调大型语言模型(LLM)。它旨在通过优化基于多个采样输出的平均奖励策略来改进模型在特定任务上的行为和性能。该方法因其效率而备受关注,因为它无需计算成本高昂的Critic网络,是标准PPO的一种内存和资源友好的替代方案。
- GRPO与PPO等其他强化学习方法有何不同?
- GRPO是近端策略优化(PPO)的一个变体。关键区别在于GRPO去除了Critic网络,而Critic网络是PPO中用于估计价值函数的一个组成部分。相反,GRPO依赖于奖励模型来对多个生成的输出来评分,并根据这些奖励的组平均值计算优势。这种设计选择减少了计算和内存开销,尽管可能会增加生成时间。它还将KL正则化置于其损失函数中,以在探索和利用之间保持平衡。
- GRPO已显示出显著影响的近期应用有哪些?
- GRPO已应用于各种前沿AI研究领域。例如,它被用于ANCHOR方法中进行从头开始的晶体结构发现,显著提高了新材料的发现率。在LLM训练中,Goldilocks RL利用GRPO大幅缩短了推理任务的训练时间。此外,CorrGRPO等方法增强了代码生成和代理安全等任务的多奖励学习,证明了GRPO在推进AI能力方面的多功能性和持续相关性。
- GRPO面临哪些挑战,研究是如何解决这些挑战的?
- GRPO面临诸如“泛化陷阱”(模型在训练中表现良好但在看不见的任务上性能下降)以及复杂场景下的信用分配问题等挑战。研究人员正通过CorrGRPO等创新来解决这些问题,CorrGRPO对奖励信号进行归一化,以防止小奖励被掩盖;以及GRAFT,它允许模型交换成功的轨迹以克服有限的展开预算限制。Mesh Learning也解决了灾难性策略崩溃问题,确保GRPO训练的模型能够保持多样化的推理能力。
相关
-
新的DMAST方法增强了多模态网络代理抵御跨模态攻击的能力
研究人员开发了一种名为双模态多阶段对抗性安全训练(DMAST)的新方法,以提高多模态网络代理抵御复杂攻击的鲁棒性。这些代理能够处理来自网络界面的视觉和文本信息,容易受到跨模态攻击,即操纵内容同时影响两个观察通道。DMAST将这种交互形式化为一个博弈,并采用了一个三阶段的训练流程:模仿学习、Oracle引导的微调和对抗性强化学习。这种方法显著降低了攻击成功率,同时提高了在分布外任务上的完成度,优于现有防御措施。
-
新的RoP框架提升知识图谱问答准确性
研究人员开发了一个名为Reward on Path (RoP)的新框架,以提高知识图谱问答(KGQA)模型的准确性。该方法从答案标签中学习中间监督信号,有助于更好地指导模型检索相关的KG证据。RoP通过联合监督通往同一答案的路径并单独惩罚不正确的路径来解决现有方法的局限性,从而在没有LLM精炼监督的高成本的情况下提供更精确的训练信号。
-
新方法使用预测市场训练大型语言模型进行个体行为模拟
研究人员开发了一种名为macro2mind的新方法,利用预测市场数据来训练语言模型模拟个体人类行为。该方法利用市场价格轨迹来推断参与者群体如何解读新闻和更新他们的信念,使模型能够推断他们的互动并将这些互动汇总成价格预测。该系统在SWM-Bench和Polymarket上展示了最先进的方向准确性,并在Humanual、OvertonBench、PRISM和计算机辅助设计应用等四个其他用户模拟基准测试中表现出强大的零样本迁移能力。
-
研究发现:AI 模型在未见过的任务上会陷入“泛化陷阱”
本文详细介绍了多奖励强化学习基准测试的第二部分,重点关注不同算法在未见过的任务上的表现。该研究在去中心化交易所套利环境中,使用 Qwen3-14B 模型测试了包括 CISPO 和 DAPO 在内的七种强化学习算法。结果显示,尽管 CISPO 获得了很高的训练奖励,但其在冻结测试任务上的表现与未经训练的基线模型相比显著下降,突显了潜在的“泛化陷阱”,即训练指标可能具有误导性。
-
Qwen3 14B 模型实验比较强化学习技术 · 跟踪 2 个来源
对 Qwen3 14B 模型进行了实验,以评估各种强化学习技术,包括 GRPO、DAPO++、CISPO、Adapoides 和 REPO-RECK。该研究侧重于比较这些方法是否包含“思考”组件,并展示了完整的留存结果、奖励曲线和资源使用数据。研究还涉及了网络抓取和多账户管理等高风险自动化任务。
-
新方法通过分析反事实视图来提升视频LLM推理能力
研究人员推出了一种新颖的视频多模态大语言模型(MLLM)训练后方法——行为包优化(BPO)。BPO通过计算反事实视图输出包的奖励,解决了MLLM依赖外观和语言先验而非时间证据的问题。该方法鼓励模型在发生无关干预时保持稳定,在关键证据被移除时保持敏感,并在没有证据时弃权。将其应用于Qwen2.5-7B-Instruct后,BPO显著提高了在TempCompass、MVBench和NExT-QA等基准测试上的准确性,并在Video-MME…
-
新的Mesh Learning方法可防止RLVR训练的LLM出现策略崩溃
研究人员在通过可验证奖励强化学习(RLVR)训练的大型语言模型中发现了一种称为灾难性策略崩溃的现象。当GRPO等算法过度限制模型的推理能力,导致不同策略无法访问时,就会发生这种崩溃。为了解决这个问题,开发了一种名为Mesh Learning的新方法,该方法鼓励保留多种推理策略。在AIME26和GPQA等基准测试上的实验表明,当应用于Qwen和Phi Llm等模型时,Mesh Learning的性能明显优于现有方法。
-
新的Goldilocks RL方法可大幅缩短语言模型推理的训练时间
研究人员开发了Goldilocks RL,这是一种新颖的自适应数据选择策略,旨在提高强化学习在语言模型推理任务训练中的效率。该方法利用选择器网络来识别对模型当前能力而言既不太容易也不太困难的问题,从而优化学习过程。在OpenMathReasoning和Polaris数据集上的实验表明,Goldilocks RL可以实现与标准GRPO相当的性能,但优化步骤减少多达78%,显著缩短了训练时间和计算资源。
-
新的“Follow the Winners”算法增强了LLM的强化学习
研究人员推出了一种名为“Follow the Winners”(FTW)的新型无批评者强化微调算法,专为代理式大型语言模型(LLM)设计。与依赖于有状态环境中不切实际的重复回滚的现有GRPO风格方法不同,FTW使用回放缓冲区样本上的序数滤波器来适应交叉熵方法。这种方法允许回报的顺序统计量具有多项式集中性,使其适用于无法进行重复回滚的场景。在代理式LLM的后训练中,FTW在Sokoban和Search-R1基线上表现出与GRPO和PPO…
-
新的FSPO控制器增强了LLM强化学习的后训练
研究人员开发了FSPO,这是一种新颖的反馈状态控制器,旨在改进大型语言模型(LLM)的后训练强化学习过程。FSPO通过学习策略一致的风险价值模型并采用决策条件轨迹校准来解决适应LLM行为的关键挑战。它还引入了帕累托资源续期证书,以确保多资源分配的可行性。在评估中,与现有的自适应基线相比,FSPO在保留数据和分布外数据上的准确性均显示出显著的提升。
-
开放权重模型 apex-flash-1 应对安全研究任务
Cantina Security 与 Yeta Labs 合作推出了 apex-flash-1,这是一个专门为漏洞研究设计的开放权重大型语言模型。该模型是 GLM-5.3-Flash 的微调版本,在 60 个预留的 bug 任务上达到了 66.7% 的通过率,展示了其在安全研究方面的能力。虽然其表现略低于 Anthropic 的 Claude Opus 5 High,但 apex-flash-1 的成本效益显著,运行成本约为 2.38…
-
新AI训练方法无需参数调整即可提升模型推理能力
研究人员开发了一种名为On-Policy Power Distillation (OPPD) 的新颖方法,用于训练语言模型以提高其推理能力,而无需外部评分或参数更改。OPPD直接训练模型生成更优化的答案,有效地将概率转移到模型最可能正确的响应上。该技术在MATH500、GSM8K和HumanEval等多个基准测试中显示出显著的准确性提升,优于GRPO等现有方法,并取得了与广泛候选采样相当的收益。
-
新研究解决语言代理的长时决策问题 · 跟踪4个来源
研究人员正在开发新方法来提高语言代理的长时决策能力。一种名为RELACE的方法使用回顾性似然评分来评估行动在原始和结果增强上下文中的合理性,在ALFWorld和WebShop等任务上取得了显著改进。另一个框架Stateless Language Agents (SLAs) 将研究状态与代理对话分开,使无状态代理能够专注于顾问分配的特定任务,从而以更少的token获得更好的性能。此外,一项关于行动校准的研究表明,明确地将过去的行动与其结…
-
新的 RLVR 方法从未来的模型检查点学习
研究人员开发了一种名为时间自蒸馏的新方法,用于具有可验证奖励的强化学习 (RLVR)。该技术允许模型从其自身的未来检查点学习,假设一个“近未来”的教师模型比一个“远未来”的教师模型能提供更好的新能力和可迁移性之间的平衡。该研究引入了近未来策略优化 (NPO) 和近未来策略蒸馏 (NPD) 机制,以及用于自适应指导的 AutoNPO。在八个图像-文本基准上的实验表明 GRPO 分数有所提高,这表明有效的时间自蒸馏依赖于这种平衡,而不仅仅…
-
新研究解释GRPO归一化在自适应梯度中的作用
一篇新研究论文探讨了组相对策略优化(GRPO)中归一化的必要性和有效性。GRPO是语言模型强化学习的标准算法。该研究发表在arXiv上,理论上证明了GRPO的归一化充当自适应梯度,提高了比标准REINFORCE方法更快的收敛速度。研究人员还引入了重要性采样变体IS-GRPO,并在GSM8K和MATH数据集上进行了实证验证,尤其是在每提示方差异构的情况下,显示出性能提升。
-
多模态强化学习模型在有无视觉训练数据时学习技能的方式不同
一篇新的研究论文探讨了多模态强化学习模型如何学习技能,特别是与视觉信息相关的技能。研究发现,在测试期间引入图像后,未经图像训练的模型在视觉语言基准测试上仍然取得了显著的进步。然而,长时间使用真实图像进行训练可能会损害其基础能力,而基准测试分数却保持较高水平,这表明训练期间的视觉输入与其有效利用之间存在脱节。该研究提出了一个“视觉可解性”规则,确保视觉证据对于正确答案至关重要,并且任务仍然可学习,这提高了一个7B模型在识别新场景中的目标时的准确性。
-
新的 ISO-AdamW 优化器显示出比标准 AdamW 略有优势
一种名为 ISO-AdamW 的新优化器被测试了其在训练大型语言模型方面的有效性,并与标准的 AdamW 进行了比较。虽然 ISO-AdamW 显示出轻微的改进,在 1000 道数学题考试中取得了 758 个正确答案,而 AdamW 取得了 754 个,但这种微小的增益不足以证明在生产系统中取代已有的 AdamW 优化器是合理的。该实验在 NVIDIA H200 GPU 上进行了受控设置,重点关注了等谱性(isospectrality…
-
FlowHMR框架从视频生成物理上可行的3D人体运动
研究人员开发了FlowHMR,一个从单目视频生成物理上可行的3D人体运动的新框架。该方法通过将运动捕捉构建为视频条件生成问题来解决先前方法的局限性,并使用组相对策略优化(GRPO)进行增强。FlowHMR使用保真度和跟踪奖励来确保运动与输入视频一致,并且能够被基于物理的控制器成功跟踪。在新Wild-4K数据集上的实验表明,FlowHMR的性能显著优于现有方法,物理跟踪成功率达到82.47%,而最强的基线GVHMR为62.82%。
-
新研究解决了 GRPO 的信用分配问题
一篇研究论文解决了 GRPO 框架内的信用分配问题。提出的解决方案旨在通过避免评估过程中每一步的需要来提高 GRPO 的效率。这项工作在 Mastodon 上分享,并在 Hacker News 上进行了讨论。
-
新的DHO方法提升3D网格生成质量
研究人员开发了一种名为动态归巢优化(DHO)的新型强化学习方法,利用流匹配来改进3D网格生成。该方法将优化重新定义为正样本吸引过程,引导轨迹趋向首选样本。DHO结合了最小成本吸引匹配(MAM)来分配特定目标,以及时间感知动态校正(TDC)来根据剩余时间调整轨迹。该框架名为Flow3D-Pro,与现有的网格生成技术相比,展示了卓越的几何质量,并且在性能上优于DPO、GRPO和NFT风格等其他强化学习目标。