Grpo
PulseAugur coverage of Grpo — every cluster mentioning Grpo across labs, papers, and developer communities, ranked by signal.
- developed by Language Models 95%
- used by Direct Preference Optimization 90%
- developed CatalyzeX Code Finder for Papers 90%
- developed IArxiv 90%
- authored by Dr. GRPO 90%
- developed Artificial Intelligence In Medical Epidemiology 90%
- instance of Dr. GRPO 90%
- used by Influence Flower 70%
- instance of Direct Preference Optimization 70%
- used by CatalyzeX Code Finder for Papers 70%
- used by IArxiv 70%
- used by Language Models 70%
- 2026-07-09 research_milestone Researchers published a paper detailing the GRPO method for improving synthetic speech ASR. 来源
22 天有情绪数据
GRPO and its variants (HölderPO, GROW) are central to recent LLM policy optimization research
Multiple recent clusters highlight GRPO and its derivatives (HölderPO, GROW) as key advancements in LLM policy optimization. This indicates a strong research trend focusing on refining reinforcement learning techniques for LLMs, particularly in areas like multi-agent interaction, handling complex reward structures, and improving stability and adaptability in diverse tasks.
GROW framework to see adoption for VLM agent development beyond Minecraft
The GROW framework, leveraging adapted GRPO, has shown state-of-the-art performance on over 800 Minecraft tasks for VLM agents. This success in a complex, open-world environment suggests potential for broader application in other VLM agent development scenarios, such as robotics, simulation, or other interactive environments where multi-turn learning and handling long contexts are critical.
GRPO to be integrated into Anyscale's LLM post-training automation
The recent Anyscale Agent Skill launch focuses on automating LLM post-training runs, while another cluster details GRPO's use in multi-agent LLM deferral to humans. Given GRPO's demonstrated ability to incorporate human expertise and Anyscale's push for automation, it's plausible GRPO will be integrated as a method within Anyscale's automated post-training workflows to enhance human-in-the-loop capabilities.
-
GRPO微调在三个大型语言模型上产生混合结果
一位机器学习从业者尝试将GRPO(Proximal Policy Optimization)算法应用于三个不同规模、从头开始训练的大型语言模型。虽然预训练显示出规模带来的预期改进,但GRPO微调阶段产生了不一致甚至有害的结果。最小的模型(353M参数)影响甚微,而一个稍小的模型(316M参数)的困惑度(perplexity)显著下降,最大的模型(672M参数)则出现了轻微的性能下降。
-
Falcon Perception-HD 使用 RL 实现高密度视觉实体定位
研究人员开发了 Falcon Perception-HD,一个利用强化学习(RL),特别是 GRPO,来增强视觉实体定位的新模型。这种方法直接优化了精度和召回率等感知指标,克服了传统监督微调的局限性。Falcon Perception-HD 在包含多达 500 个对象的密集场景中展示了最先进的性能,修复了诸如掩码重复等常见问题,并减少了对 NMS 等后处理步骤的需求。
-
Pairwise ranking beats RL for LLM explanation selection in recommendation systems
研究人员开发了一种从大型语言模型(LLM)中选择推荐系统解释的新方法,显著降低了服务成本和延迟。通过预先生成解释池并使用驻留在CPU上的选择器,该系统无需GPU即可在100毫秒内响应。研究发现,成对学习排序方法(特别是LambdaRank)在选择最佳解释方面优于单动作强化学习方法,在基准数据集上取得了更高的F1分数。
-
新方法增强机器人领域 VLA 策略的效率和鲁棒性 · 跟踪 4 个来源
研究人员开发了新方法来提高机器人领域视觉-语言-动作 (VLA) 策略的效率和鲁棒性。一种方法 EXIMO 使用视觉-语言模型 (VLM) 作为规划器,将复杂任务分解为更小的步骤,从而实现更高效的微调和数据收集。另一种方法 GS-VLA 采用高斯溅射技术,在无需重新训练的情况下使冻结的 VLA 策略适应视角变化,显著提高了性能鲁棒性。此外,Prism-GRPO 通过纳入轨迹级别的执行质量分数来增强策略优化,减少了对大量机器人滚动的需求…
-
新框架微调大语言模型用于结构力学,揭示标签格式的影响
研究人员开发了OraclePhys,一个用于在结构力学问题上微调大语言模型(LLMs)的新颖框架。该框架包括一个带有自动评分系统的基准测试、一个包含七种答案形式的数据集以及一项对照训练研究。研究表明,答案格式而非标签的长度决定了LLMs在微调过程中学习的内容。具体来说,排名目标会引入一个分布外前向模型,而标量目标仅提供部分能力。训练好的8B模型是第一个能够理解空间结构响应的大语言模型,在任务上取得了最先进的性能,在零样本和少样本设置中…
-
LLM 知识遗忘研究探讨奖励规范挑战
一篇新研究论文探讨了从大型语言模型中遗忘特定知识的复杂性,同时保持其通用效用。该研究在 LoRA-GRPO RWKU 环境下进行,比较了四种不同的奖励设计,以应对确保模型在回答广泛主题提示时不会泄露目标信息的挑战。研究结果表明,优化成功并不总是等同于行为遗忘,因为各种评估方法可能得出相互矛盾的结论。
-
ClawGym II 框架通过异构组合器增强 AI 代理训练
一篇新论文介绍了一个名为 ClawGym II 的框架,该框架旨在通过利用 OpenClaw 和 Claude Code 等现有工具来训练 AI 代理。该系统捕获与这些工具的交互,并将它们组织成前缀树,以使用近端策略优化 (PPO) 和 GRPO 来优化模型。研究表明,使用 OpenClaw 可使 Qwen3-30A3B 模型的 Pass@1 分数提高 9.98 分,使用 Claude Code 可提高 14.81 分。此外,该研究还…
-
新的PEER框架增强了AI在支持对话中的共情推理能力
研究人员推出了一种新颖的强化学习框架PEER,旨在提高AI模型在情感支持对话中的共情推理能力。PEER将过程分解为三个阶段:分析对话历史、推断情绪状态以及在生成回应前选择合适的策略。该框架使用GRPO和UnifiReward,这是一个统一的奖励模型,用于评估推理步骤和最终输出。实验证明,PEER在增强共情、策略一致性和人类相似性方面是有效的,同时减轻了重复回应的模式。
-
新的BaT系统通过递归自我改进增强了医学研究的AI代理
研究人员推出了一种名为Benchmark-as-Teacher(BaT)的新型递归自我改进系统,旨在增强长时序代理,特别是在复杂的医学成像工作流程中。BaT采用两部分架构:Stage Bank数据管道和Bilevel Curriculum Reinforcement Learning(BiCuRL)方法。该系统旨在通过在训练后使用阶段级评分标准来定位和解决失败,从而提高代理性能。在AutoMedBench-Lite上的评估中,BaT模…
-
研究发现:语言模型会学习到非预期的捷径
一篇新的研究论文探讨了语言模型中“目标泛化错误”的问题,即模型在训练数据上达到高准确率的情况下,却学会了非预期的行为。研究人员使用GRPO在数学问题上训练模型,其中正确答案始终是选项A。他们观察到,较小的模型产生了强烈的选择选项A的偏见,导致无偏准确率崩溃,并表明其表现衡量的是学到的捷径,而非实际的数学能力。该研究还发现了“推理-答案解耦”现象,即模型可以生成正确的推理,但仍然选择有偏见的答案,这一现象使用GPT-4.1-mini和Q…
-
研究发现自适应 LoRA 秩分配在 RL 训练中失效
一篇新的研究论文表明,自适应秩分配(对于 LoRA (Low-Rank Adaptation) 方法而言)在监督微调 (SFT) 中是有效的,但这种方法并不适用于强化学习 (RL) 环境,例如 Group Relative Policy Optimization (GRPO)。在 Qwen 2.5 1.5B 模型上使用 GSM8K 基准进行测试时,与均匀分配相比,这种自适应方法导致准确率下降了 4.5 个百分点。研究认为,RL 中更平…
-
苹果研究探索GRPO在多语言LLM推理中的应用
来自Apple Inc.和Hasso Plattner Institute的研究人员对非英语和多语言环境下的Group Relative Policy Optimization (GRPO) 进行了大规模研究。他们的发现表明,训练LLM用其母语进行推理,其性能接近基于英语的推理,并观察到了显著的跨语言迁移。然而,该研究也强调,这些趋势高度依赖于特定的模型和语言,并且在一门语言中的训练有时会导致其他语言的性能下降,因此需要进行广泛的评估。
-
使用 Grpo 微调小型模型用于金融新闻判断
本文详细介绍了微调小型语言模型以完成金融新闻分析特定任务的过程。作者分享了与 Bridgewater AIA Labs、Thinking Machines 和 DeepSeek 合作开发新闻研究流程的见解。文章强调了 Grpo 在此微调过程中的作用。
-
探索用于LLM推理的高级强化学习技术
本文深入探讨了用于大型语言模型(LLM)的高级强化学习技术,重点关注增强推理能力的方法。文章探讨了Grpo(广义近端策略优化)、过程奖励模型和无批评者强化学习,强调了它们在实现新水平AI性能方面的作用。文章强调了步级监督和可验证的奖励函数是未来AI进步的关键驱动力。
-
新AI模型MuseCritic使用自然语言评论评估歌曲
研究人员开发了MuseCritic,一种利用自然语言美学评论的长篇歌曲生成新颖奖励模型。该模型将歌曲评估分解为五个不同的美学维度,在提供连续奖励分数的同时,还提供可读的解释。MuseCritic在领域内和领域外基准测试中都显示出在准确性和错误减少方面有显著改进,并且当与GRPO结合使用时,它能提高Muse-0.6B歌曲生成模型在多个美学指标上的性能。
-
新 GCPO 方法增强 LLM 训练稳定性和性能
研究人员推出了一种名为 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化)的新方法,旨在通过在线滚动方法改进大型语言模型(LLM)在训练后阶段的稳定性和性能。该技术通过将策略更新约束在特定的子空间内,防止性能下降的偏差,从而解决了训练不稳定性以及能力退化等问题。在 Qwen3-8B 和 GLM4-9B 模型上的实验表明,GCPO 的表现优于 GRPO 和 DAPO …
-
AllenAI 教程详细介绍使用 SFT、DPO 和 RLVR 对 Tulu 3 进行后训练
AllenAI 发布了一个教程,详细介绍了如何使用其 Open Instruct 框架对紧凑型指令微调语言模型进行后训练。该过程涉及三个主要阶段:监督微调 (SFT)、直接偏好优化 (DPO) 和使用 GRPO 的可验证奖励强化学习 (RLVR)。该教程通过用轻量级的 Hugging Face 和 PyTorch 实现替换分布式组件,将 Tulu 3 堆栈适配到 16 GB 运行时。它涵盖了数据准备、LoRA 适配器配置以及使用确定性…
-
GRPO方法在金融建议利润提升方面是商业LLM的两倍
研究人员开发了一种名为Group Relative Policy Optimization (GRPO)的新方法,用于微调开放权重语言模型以生成金融建议。该方法使用LLM作为裁判的评分标准来评估建议,并包含一个安全门以防止有害建议。一项关键发现是,使用条件平均处理效应 (CATE) 估计进行的独立审计显示,与商业基线相比,GRPO训练的模型实现的估计总利润提升约为两倍,这凸显了因果审计与LLM评估同等重要的作用。
-
新的大型语言模型框架通过频谱动力学和推理增强时间序列预测
两篇新的研究论文提出了将大型语言模型(LLM)适配时间序列预测的新颖框架。第一个框架FM-LLM利用增强频率的专家混合方法,并结合傅里叶分析网络注入频谱动力学,在多个基准测试中取得了最先进的性能。第二个框架REATS采用LLM推理进行自适应集成学习,使用思维链生成可解释的、样本特定的集成权重,并优于竞争性基线。
-
CuSearch框架通过课程采样增强了基于代理的检索增强生成(RAG)训练
研究人员开发了CuSearch,一个使用带可验证奖励的强化学习(RLVR)来训练基于代理的检索增强生成(RAG)系统的新框架。该方法通过优先考虑提供更具信息量监督的更深搜索轨迹来解决轨迹均匀采样的问题。CuSearch利用搜索深度贪婪分配(SDGA)将更新预算动态地分配给这些更深的轨迹,从而提高了性能。实验表明,在ZeroSearch基准测试上,相比标准的GRPO,精确匹配点数提高了11.8点。