Group Relative Policy Optimization
PulseAugur coverage of Group Relative Policy Optimization — every cluster mentioning Group Relative Policy Optimization across labs, papers, and developer communities, ranked by signal.
- instance of Grpo 90%
- developed Gotit.pub 90%
- developed ScienceCast 90%
- used by Grpo 70%
- instance of alphaXiv 70%
- developed Reinforcement Learning with Verifiable Rewards 70%
- used by CatalyzeX 70%
- used by Gotit.pub 70%
- competes with Reinforcement Learning with Verifiable Rewards 70%
- uses Reinforcement Learning with Verifiable Rewards 70%
- used by ALFWorld 70%
- developed ALFWorld 70%
- 2026-06-16 research_milestone A research paper details the application of Group Relative Policy Optimization to enhance LLM event forecasting. 来源
18 天有情绪数据
-
ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力
研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…
-
新的智能体框架解决了多页文档视觉问答问题
研究人员推出 Doc-V*,一个无 OCR 的智能体框架,专为多页文档视觉问答而设计。该系统采用粗粒度到细粒度的交互式方法,解决了处理长而视觉密集型文档的挑战。Doc-V* 首先进行广泛概述,然后使用语义检索和定向页面获取来收集证据,这些证据随后在结构化工作内存中进行聚合以进行推理。与检索增强生成基线相比,该框架在各种基准测试中的域外性能提高了高达 47.9%。
-
新的强化学习框架推进3D点云质量评估
研究人员推出PCQA-R1,一个新颖的无参考3D点云质量评估强化学习框架。该系统利用链式思考数据集和高斯邻近奖励来提高跨不同数据集和评分尺度的泛化能力。实验表明,PCQA-R1在跨数据集泛化方面达到了最先进水平,并在域内准确性方面具有竞争力。
-
新框架利用编辑判断对齐音频大语言模型以实现章节划分
研究人员开发了AudioChaps,一个用于对齐音频大语言模型(LALMs)以执行音频章节划分任务的训练后框架。该框架利用组相对策略优化(GRPO)和思维链(CoT)推理来改进LALMs将连续音频流分割成主题连贯章节的方式。为此,精心整理了三个新数据集——AudioChaps-Alignment、AudioChaps-CoT和AudioChaps-Eval,其中后者用作基准。使用此框架训练的AudioChaps-R1模型在章节划分任务…
-
TAMP-Nav 框架增强大型视觉语言模型(VLMs)的具身导航能力
研究人员推出 TAMP-Nav,一个旨在增强大型视觉语言模型(VLMs)具身导航能力的新框架。该方法将导航任务重新构建为二维视觉提示,使 VLMs 能够选择像素,然后将这些像素投影到三维坐标以执行。TAMP-Nav 还包含一个选择性推理机制,仅在关键节点触发思维链(Chain-of-Thought),并使用锚点轨迹记忆(Anchor-Trajectory Memory)来压缩冗余路径。该框架在 R2R-CE 等基准测试中取得了最先进的…
-
苹果研究探索GRPO在多语言LLM推理中的应用
来自Apple Inc.和Hasso Plattner Institute的研究人员对非英语和多语言环境下的Group Relative Policy Optimization (GRPO) 进行了大规模研究。他们的发现表明,训练LLM用其母语进行推理,其性能接近基于英语的推理,并观察到了显著的跨语言迁移。然而,该研究也强调,这些趋势高度依赖于特定的模型和语言,并且在一门语言中的训练有时会导致其他语言的性能下降,因此需要进行广泛的评估。
-
新的TraVEL框架通过运动感知嵌入增强驾驶视频检索
研究人员开发了TraVEL,一个用于学习专门针对驾驶视频检索的视频嵌入的新框架。该方法使用配对剪辑和推理轨迹的监督微调,然后进行运动感知微调,来微调一个通用多模态嵌入模型Qwen3-VL-Embedding。TraVEL在策略优化框架内使用自我轨迹相似性作为奖励信号,以增强对运动中心事件的理解,在一个新的驾驶视频检索基准上显著优于标准微调。
-
大型语言模型在多语言API调用中遇到困难;监督微调显示出潜力
一项新的研究论文探讨了大型语言模型(LLMs)在多语言工具使用方面面临的挑战,特别是解决了“参数语言不匹配”(ALM)的问题。当LLM正确识别工具但生成的参数语言不一致时,就会出现此问题,导致输出无效。研究发现,监督微调(SFT)是缓解ALM的非常有效的方法,可显著提高参数语言一致性和整体函数调用准确性。虽然像Group Relative Policy Optimization(GRPO)这样的强化学习(RL)方法在语言一致性和一般推…
-
GRPO方法在金融建议利润提升方面是商业LLM的两倍
研究人员开发了一种名为Group Relative Policy Optimization (GRPO)的新方法,用于微调开放权重语言模型以生成金融建议。该方法使用LLM作为裁判的评分标准来评估建议,并包含一个安全门以防止有害建议。一项关键发现是,使用条件平均处理效应 (CATE) 估计进行的独立审计显示,与商业基线相比,GRPO训练的模型实现的估计总利润提升约为两倍,这凸显了因果审计与LLM评估同等重要的作用。
-
新的CARE框架提升了医学VQA模型的可靠性和可信度
研究人员开发了CARE,一个旨在提高医学视觉问答(VQA)模型可靠性的框架。CARE解决了置信度失校准问题,即模型表达的确定性与其诊断准确性不符。该框架采用两阶段流程,包括使用合成的医学思维链数据进行监督微调,以及在组相对策略优化中引入新颖的置信度感知奖励机制,以更好地使置信度与正确性保持一致。在三个医学VQA基准上的评估表明,CARE在提高诊断准确性的同时,降低了校准误差和幻觉率,为更值得信赖的临床决策支持工具铺平了道路。
-
新方法利用SAM和强化点选择增强人群实例分割
研究人员开发了一种名为密集点到掩码优化(DPMO)的新方法,以改善密集人群场景下的实例分割。DPMO集成了Segment Anything Model(SAM)和最近邻排他圆(NNEC)约束,以从点标注生成详细掩码。此外,还引入了一个使用组相对策略优化(GRPO)训练的强化点选择(RPS)框架,以选择最准确的点预测用于实例分割。这些进展在多个群体计数数据集上取得了最先进的性能,证明了掩码标注在提高计数准确性方面的价值。
-
进化策略 vs GRPO:LLM 后训练产生不同的模型更新
一篇新的 arXiv 论文比较了用于大型语言模型后训练的进化策略(ES)和群组相对策略优化(GRPO)。虽然这两种方法在单任务和顺序学习场景中都能达到可比的准确性,但它们产生的模型更新却显著不同。ES 会引起更大、更广泛的变化,并伴有更多的离轨 KL 漂移,而 GRPO 则进行更小、更局部的调整。研究表明,无梯度和基于梯度的微调可以得出精度相似但几何形状不同的解决方案,从而影响知识保留和遗忘。
-
无批评者深度强化学习框架优化海上路径规划
研究人员开发了一种新颖的无批评者深度强化学习(DRL)框架,用于不规则六边形网格上的海上覆盖路径规划。该方法利用基于Transformer的指针策略来构建最优覆盖路线,克服了传统分解方法的局限性。该系统在合成环境中实现了99.1%的汉密尔顿成功率,在路径效率和航向改变方面优于启发式基线,并且推理时间适合实时船载部署。
-
新基准和方法增强多模态AI推理和可信度 · 跟踪4个来源
研究人员正在开发新方法来提高多模态大语言模型(MLLMs)的可靠性和可信度。一种方法VERDICT利用多个验证器之间的分歧来识别推理步骤中的错误,而无需额外的训练数据。另一种方法AD2-Bench引入了一个分层诊断框架,以查明证据获取中的失败,区分空间歧义和语义不确定性。此外,StructReward提供了一个高效的框架,通过提供结构化的、步骤级别的奖励来实现多模态推理的自我纠正,降低了强化学习的计算开销。最后,MMArch提供了一个…
-
Omni2LoRA框架提升全模态语言模型效率
研究人员开发了Omni2LoRA,一个旨在提高全模态语言模型(OLMs)处理长音频-视频序列效率的新框架。该方法使用Perceiver hypernetwork将多模态上下文提炼到低秩适配(LoRA)适配器中,绕过了token序列的计算瓶颈。该框架采用Group Relative Policy Optimization(GRPO)来分配固定的秩预算,优先考虑跨模态连贯性而非孤立特征。Omni2LoRA在准确性方面表现出显著的改进,并减…
-
新的GRASP方法通过设备端训练增强语言模型匿名化
研究人员开发了GRASP,一种用于增强语言模型匿名器的新方法。与依赖直接偏好优化(DPO)的先前方法不同,GRASP使用群体相对策略优化来训练一个单一的、小型设备端模型。该模型充当匿名器、对抗者和效用判断者,同时优化隐私和意义保留。与DPO基线相比,GRASP展示了改进的隐私-效用权衡,并且在隐私和意义保留方面取得了与Gemini 2.5 Flash和Claude等前沿模型相当或更好的结果,同时运行成本仅为GPT-4o的一小部分。
-
新的ABC-GRPO算法增强了LLM训练的稳定性和性能
研究人员推出了一种名为全象限有界裁剪GRPO(ABC-GRPO)的新型算法,旨在提高大型语言模型(LLM)强化学习的稳定性和泛化能力。ABC-GRPO通过在似然比和优势空间的全部四个象限上应用无条件裁剪,解决了现有组相对策略优化(GRPO)方法中存在的无界盲点。这种新方法在使用Qwen3基础模型进行的数学推理任务上表现出卓越的性能,与GRPO、SAPO和双裁剪PPO相比,在Avg@64和Pass@64上取得了更高的分数,同时还保持了更…
-
新的RA-CAD代理通过反馈循环改进文本到CAD生成
研究人员开发了RA-CAD,这是一种新颖的代理,旨在通过整合状态感知的反馈循环来改进文本到CAD的生成。该系统通过生成-执行-评估-重写周期运行,其中它执行生成的代码,分析结果,并生成明确的评估来指导后续的修订。RA-CAD在CADFusion和Text2CAD等基准测试中展示了在执行有效性和几何质量方面的最先进性能,优于现有方法和专有语言模型。
-
新的Hi-Token方法提高了AI模型中的视觉基础准确性
研究人员开发了一种新颖的生成式视觉基础方法Hi-Token,通过分层标记坐标来提高边界框预测的准确性。该方法对百位、十位和个位数字进行编码,增加了结构并促进了视觉-语言模型中的标记重用。作为Hi-Token的补充,Hi-GAR在训练过程中使用基于几何的奖励来进一步提高定位精度。在多个视觉-语言模型骨干和基准上的实验表明,性能持续提升,其中Hi-R1与现有的专业方法相比取得了更优异的结果。
-
AI通过新的推理和对齐框架推动放射学报告生成 · 已追踪4个来源
研究人员开发了几个新框架,以使用AI改进放射学报告生成。HERO通过将策略优化分解为推理、诊断和证据关联来优化多模态大型语言模型,在MIMIC-CXR和IU-Xray数据集上显示出最先进的临床疗效。PDD-RRG引入了一个后验诊断决策阶段,通过整合潜在冲突的诊断来完善报告,使用贝叶斯后验概率,在不重新训练的情况下增强现有模型。RadPRISM使用模式分层监督来对齐专用视觉子空间内的临床概念,改进了零样本分类和视觉关联。PALM采用病理…