Reinforcement Learning with Verifiable Rewards
PulseAugur coverage of Reinforcement Learning with Verifiable Rewards — every cluster mentioning Reinforcement Learning with Verifiable Rewards across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
苹果研究探索GRPO在多语言LLM推理中的应用
来自Apple Inc.和Hasso Plattner Institute的研究人员对非英语和多语言环境下的Group Relative Policy Optimization (GRPO) 进行了大规模研究。他们的发现表明,训练LLM用其母语进行推理,其性能接近基于英语的推理,并观察到了显著的跨语言迁移。然而,该研究也强调,这些趋势高度依赖于特定的模型和语言,并且在一门语言中的训练有时会导致其他语言的性能下降,因此需要进行广泛的评估。
-
新的PAIR方法优化RLVR计算分配
研究人员开发了一种名为PAIR(Pairwise-Aware Inclusion Reweighting)的新方法,用于优化可验证奖励强化学习(RLVR)中的计算资源分配。该方法通过考虑不同推理轨迹之间的成对关系,而不是独立处理它们,来解决现有分配器中的统计不匹配问题。PAIR将这些关系建模为一个对比图,并使用仅前缀预测器来估计正确性和成本,与之前在Qwen3模型上的方法相比,提高了准确性并显著减少了生成的token数量。
-
CuSearch框架通过课程采样增强了基于代理的检索增强生成(RAG)训练
研究人员开发了CuSearch,一个使用带可验证奖励的强化学习(RLVR)来训练基于代理的检索增强生成(RAG)系统的新框架。该方法通过优先考虑提供更具信息量监督的更深搜索轨迹来解决轨迹均匀采样的问题。CuSearch利用搜索深度贪婪分配(SDGA)将更新预算动态地分配给这些更深的轨迹,从而提高了性能。实验表明,在ZeroSearch基准测试上,相比标准的GRPO,精确匹配点数提高了11.8点。
-
新框架通过知识引导增强医学数学推理能力
研究人员推出 MedCalc-R1,一个新颖的知识引导奖励框架,旨在提高医学背景下的数学推理能力。该框架解决了现有可验证奖励强化学习 (RLVR) 方法的局限性,例如阈值校准困难和训练动态不稳定。MedCalc-R1 包含一个知识验证奖励机制,强制显式生成和验证计算公式,从而提高可解释性和可靠性。此外,它采用混合软硬奖励方案,将临床安全阈值与精度敏感奖励相结合,以在可接受的范围内指导学习。实验表明,该方法在准确性和泛化性方面均显著优于…
-
新基准和方法增强多模态AI推理和可信度 · 跟踪4个来源
研究人员正在开发新方法来提高多模态大语言模型(MLLMs)的可靠性和可信度。一种方法VERDICT利用多个验证器之间的分歧来识别推理步骤中的错误,而无需额外的训练数据。另一种方法AD2-Bench引入了一个分层诊断框架,以查明证据获取中的失败,区分空间歧义和语义不确定性。此外,StructReward提供了一个高效的框架,通过提供结构化的、步骤级别的奖励来实现多模态推理的自我纠正,降低了强化学习的计算开销。最后,MMArch提供了一个…
-
新的RLVR方法增强LLM的鲁棒性和泛化能力 · 跟踪2个来源
研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著降低。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型上,对于数学推理和代码生成…
-
新的RLVR方法增强了多模态LLM在提示变化下的鲁棒性
研究人员开发了一种名为提示不变RLVR(PIRL)的新方法,以提高多模态大语言模型(MLLMs)在使用可验证奖励强化学习(RLVR)时的鲁棒性。标准的RLVR方法很脆弱,提示的微小变化会显著降低性能,这对于高风险应用来说是个问题。PIRL通过在奖励信号中分离内容和格式,并训练模型对语义等价的提示变化保持不变来解决这个问题。与GRPO等现有方法相比,这种方法在压力测试和动态评估下表现出显著更好的性能。
-
新研究解决大语言模型推理、可靠性和可解释性问题
近期研究探索了提高大语言模型(LLMs)推理能力和可靠性的方法。论文引入了行为提升(Behavioral Lift)等新指标来量化推理行为,并识别出放大提升差距(Amplification-Lift Gap),表明训练应侧重于校准和基于事实的推理。其他工作提出了感知-纠正蒸馏(Perception-Correction Distillation)等技术来解决多模态推理中的失败问题,以及 SheetCompass 通过模拟结构关系来增强…
-
新的 GeoRA 方法增强了大型语言模型的 RLVR
研究人员推出了一种新颖的低秩适应方法 GeoRA,该方法专门为具有可验证奖励的强化学习 (RLVR) 设计。与现有的专注于监督微调的方法不同,GeoRA 考虑了 RLVR 中固有的独特优化动态和几何结构。通过利用奇异值分解提取 RL 更新子空间的主方向,GeoRA 有效地保留了预训练模型的结构,同时实现了高效的计算。在 Qwen 和 Llama 模型上的实验表明,GeoRA 在数学、医学和编码等各种 RLVR 任务中优于其他低秩适应技…
-
新方法RSTG通过自适应教师指导改进LLM强化学习
研究人员开发了RSTG(Recovering Learning Signals via Adaptive Teacher Guidance,通过自适应教师指导恢复学习信号),一种改进大型语言模型强化学习的新方法。现有的GRPO等方法在稀疏奖励方面存在困难,而与在线蒸馏(OPD)的简单组合可能会降低性能。RSTG选择性地将蒸馏应用于负面提示,根据教师的置信度对样本进行加权,并针对特定标记进行蒸馏。它还通过注入正梯度来纳入教师生成的轨迹上…
-
新的奖励函数提高了 AI 模型遗忘效率,以符合隐私规定
研究人员为机器学习遗忘开发了新的奖励函数,这是一个从 AI 模型中选择性移除特定知识的过程。这对于遵守 GDPR 和欧盟人工智能法案等隐私法规至关重要。该研究引入了一种指数奖励和一种受 PageRank 启发的奖励,与之前的二元奖励相比,它们提供了更精细的惩罚,从而在保持模型效用的同时,显著加快了收敛速度并提高了效率。
-
新方法CSCR通过重新分配Token信用来改进LLM长上下文推理
研究人员开发了一种名为反事实敏感性信用重新分配(CSCR)的新方法,以提高大型语言模型的推理能力,特别是在需要长上下文推理的任务中。该方法解决了现有强化学习技术(如GRPO和On-policy self-distillation)的局限性,这些技术经常将信用错误地归因于不太重要的Token。CSCR将信用从对结果变化高度敏感的Token重新分配,而专注于承载关键推理内容的Token。这种方法在数学推理基准测试中显示出比基线方法持续的性能改进。
-
研究论文分析推理对大型语言模型翻译质量的影响
一篇新研究论文探讨了具有可验证奖励的强化学习(RLVR)在训练大型语言模型(LLMs)方面的有效性,特别是在神经机器翻译(NMT)领域。该研究调查了翻译质量的提高,尤其是在法律文件翻译等复杂任务中,是由于增强了推理能力还是RLVR范式本身。实验表明,在推理过程中包含模型的推理轨迹能显著提高翻译质量,但也会增加输出令牌和计算需求,从而促使对成本-质量权衡的分析。
-
新的 RLVR 框架 PACS 增强了 LLM 的推理能力
研究人员推出 PACS,一个用于可验证奖励强化学习 (RLVR) 的新颖框架,旨在提高大型语言模型 (LLM) 的推理能力。PACS 将 RLVR 重构为一项监督学习任务,使用交叉熵损失优化评分函数,从而固有地恢复稳定的策略梯度更新。实验表明,PACS 在现有开源模型和 RLVR 基线模型上的表现显著优于它们,在 4B 和 8B 模型上分别取得了超过 8% 和 9% 的显著提升。
-
新的H$^2$SD框架通过混合自蒸馏提升LLM推理能力
研究人员开发了H$^2$SD,一种新颖的混合回溯自蒸馏框架,旨在增强大型语言模型的推理能力。该方法解决了现有具有可验证奖励的强化学习(RLVR)技术的局限性,这些技术通常存在监督稀疏和令牌级信用分配不佳的问题。H$^2$SD根据轨迹的正确性来区分其方法:对于成功的路径,它会调整更新幅度;对于失败的路径,它使用参考提示来指导学生模型获得经过验证的答案。在各种推理基准上的实验表明,H$^2$SD在性能和效率方面均优于当前的RLVR、同策略…
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
新的对比策略优化方法改进了强化学习
研究人员推出了一种新颖的强化学习方法——对比策略优化(CPO),该方法具有可验证的奖励。CPO 利用生成文本分布之间的令牌级对比差异来更有效地塑造优势,解决了传统基于熵的方法的局限性。这种方法可靠地指示令牌的正确性,并能解决零优势问题等问题,在实验中优于现有的 RLVR 技术。
-
新的对比策略优化框架增强了强化学习
研究人员推出了一种新颖的强化学习框架——对比策略优化(CPO),该框架具有可验证的奖励。CPO利用参考引导生成分布和标准生成分布之间的令牌级对比差异来塑造优势,提供了比传统基于熵的方法更可靠的正确性信号。该方法在各种基准测试中表现出色,优于现有的RLVR技术,同时保持了泛化能力。
-
SIVA-RL框架通过将预测与视觉证据联系起来,增强了多模态推理能力
研究人员推出了一种新颖的SIVA-RL框架,旨在通过确保视觉语言模型将其预测与视觉证据联系起来,来改进多模态强化学习。与依赖干预类型的先前方法不同,SIVA-RL使用样本级、结果条件化的监督来使模型行为与观察到的效果保持一致。这种方法与GRPO和DAPO骨干兼容,在九个多模态推理基准测试中显示出显著的改进,将视觉依赖推理提高了8.79个百分点,整体相对改进高达14.9%。
-
新AI训练方法在主观任务中不使用评分标准,而是计算错误
研究人员引入了隐式错误计数(IEC)方法,这是一种用于训练AI模型执行理想输出主观或不存在的任务的新颖方法。与关注正确性的传统评分标准奖励系统不同,IEC识别并量化错误,为响应的不同方面分配加权分数。该方法在虚拟试穿应用领域得到验证,该领域有多种可接受的输出,并在名为MDressBench的新基准上展示了优于现有基于评分标准的方法的性能。