PulseAugur
中
实时 06:45:43
实体 Reinforcement Learning with Verifiable Rewards

Reinforcement Learning with Verifiable Rewards

PulseAugur coverage of Reinforcement Learning with Verifiable Rewards — every cluster mentioning Reinforcement Learning with Verifiable Rewards across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
62
90 天内 62
发布 · 30天
0
90 天内 0
论文 · 30天
61
90 天内 61
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/4 页 · 共 66 条
  1. RESEARCH · CL_284317 ·

    新AI方法利用过往经验改进未来预测

    研究人员推出了一种新颖的强化学习方法——自我反思蒸馏(SRD),该方法利用过往经验来改进未来预测。这项技术在最近的一篇arXiv论文中有所详述,旨在教会智能体在行动前预见结果并避免陷阱,尤其是在传统奖励信号稀缺或统一的场景中。SRD是对现有强化学习方法的补充,尤其在复杂、长周期的任务中表现出显著的性能提升。

  2. TOOL · CL_281912 ·

    RLVR 验证器设计强调确定性检查而非 LLM 裁判

    构建有效的可验证奖励强化学习 (RLVR) 系统需要高度关注验证器防御工程,这构成了开发工作的 80%。核心原则是使用确定性方法(如编译器和测试脚本)进行验证,而不是依赖其他语言模型,因为后者可能被利用偏见和提示注入。一个强大的 RLVR 系统应采用包括网关、预言机和风险评分器在内的三层架构,并辅以故障关闭网关和主动突变验证等策略,以确保代理程序引起经过验证的状态更改。

  3. TOOL · CL_275064 ·

    LineupRL框架通过可验证奖励增强时间序列标注

    研究人员开发了LineupRL,一个旨在改进时间序列标注的新型强化学习框架。该方法使用了一个可验证的奖励系统,其中大型语言模型充当验证器,根据生成的标题从干扰项中识别出正确的时间序列。LineupRL在多个基准测试中表现出优于监督微调和其他强化学习基线。其训练的视觉语言模型比用于蒸馏的模型小得多,也更有效。

  4. TOOL · CL_275034 ·

    新框架 APIVIS 通过引导搜索提升 LLM 数学推理能力

    研究人员开发了 APIVIS,这是一个旨在增强大型语言模型数学推理能力的新颖框架。该系统将有限预算的 Gumbel 搜索与可验证奖励(RLVR)的强化学习相结合,以增加训练展开的多样性。APIVIS 结合了直接响应和搜索响应,确保搜索过程中发现的改进能够积极影响模型的策略。该框架还纳入了选择性监督,以便在组奖励变得均匀时维持学习信号,否则这会阻碍 GRPO 算法。在既定的数学推理基准上的实验表明,APIVIS 的性能显著优于现有的基于搜索的方法。

  5. TOOL · CL_273295 ·

    新的LLM后训练方法增强了启发式设计

    研究人员开发了一种用于自动启发式设计(AHD)的大型语言模型(LLM)在线后训练新方法。该方法在一个新论文中详细介绍,侧重于从程序有效性和性能分数构建上下文相关的学习信号来更新LLM生成器。与之前保持生成器冻结的方法不同,该技术允许模型从评估的候选者那里学习,旨在提高有用启发式的生成。

  6. TOOL · CL_273191 ·

    研究质疑RLVR中难度标签的可靠性

    一篇新的研究论文质疑了在具有可验证奖励的强化学习(RLVR)中使用的难度标签的可靠性。研究表明,先前被认为不可学的提示实际上可能会得到改进,尽管速度较慢,并且难度标签本身的重现性不如预期。研究人员提出了一个框架来量化这种不稳定性,并确定可靠难度分配所需的评估深度,同时重新审视了用于解释慢学习现象的梯度相似性证据。

  7. TOOL · CL_258595 ·

    Apple 研究人员发布 DACA-GRPO 以改进扩散语言模型

    Apple 机器学习研究部推出 DACA-GRPO,一种用于增强扩散语言模型强化学习的新颖方法。该方法通过结合时间信用分配和减少似然估计中的偏差来解决现有强化学习技术的局限性。DACA-GRPO 在包括数学推理、代码生成和约束满足在内的各种基准测试中取得了显著的性能提升。

  8. TOOL · CL_254591 ·

    新的Bellman策略优化方法增强了LLM的推理能力

    研究人员推出了一种新颖的具有可验证奖励的强化学习(RLVR)方法——Bellman策略优化(BPO),旨在增强大型语言模型(LLMs)的推理能力。BPO是一种无判别器的方法,源自策略镜像下降(PMD),它将PMD重构为使用Bellman方程的轨迹级目标。这种重构绕过了在中间步骤估计状态值的需求,并且其实际损失函数通过基于平滑标记概率的失配校正权重进行近似。在数学推理基准上的实验表明BPO是有效的。

  9. RESEARCH · CL_254525 ·

    新研究探索用于高级 LLM 训练的数据合成和课程学习

    两篇新研究论文探讨了使用可验证奖励强化学习 (RLVR) 训练大型语言模型 (LLM) 的高级技术。第一篇论文介绍了 MIFS,一个用于合成 RL 就绪的多模态数据的管道,该管道将指令遵循能力提高了 8.13%,并将训练收敛速度提高了三倍。第二篇论文提出了一种教师指导的课程学习方法,用于解锁模型最初无法解决的问题的训练,通过创建分级难度景观,以显著减少的数据量获得相当或更好的结果。

  10. TOOL · CL_254401 ·

    CodeTS 框架通过可执行代码从文本生成时间序列

    研究人员推出了一种新颖的框架 CodeTS,用于从自然语言描述生成时间序列数据。该方法将任务重新构建为文本到代码到时间序列的过程,其中自然语言提示首先被翻译成决定时间模式的可执行代码,然后执行该代码以生成时间序列。CodeTS 利用对齐的文本-代码-时间序列三元组进行监督初始化,并采用具有可验证奖励的强化学习来训练模型,而无需直接的代码注释,从而确保格式有效性、代码可执行性和时间序列质量。在八个基准上的实验表明,CodeTS 的性能优…

  11. RESEARCH · CL_252114 ·

    新方法增强AI策略优化以应对复杂任务 · 跟踪2个来源

    研究人员开发了改进强化学习策略的新方法,特别是在数学推理等复杂任务中。一种方法HISPO引入了一种段级策略优化技术,该技术将显著性权重分配给响应的连续段,在token级和序列级方法之间提供了一个中间纠正单元。另一项开发Adversarial Importance Sampling (Advis) 专注于通过优化可验证的最坏情况回报,而无需额外的环境交互或辅助网络,来保护深度强化学习策略免受输入扰动的影响。这两种方法都旨在提高AI模型在…

  12. TOOL · CL_245486 ·

    新的电路推理分数改进了强化学习数据选择

    研究人员开发了一种名为电路推理分数(CRS)的新方法,以改进可验证奖励强化学习(RLVR)的数据选择。与将数据价值视为问题内在属性的先前方法不同,CRS根据模型对其推理电路的参与度来评估数据价值。这种方法在Qwen2.5-Math-7B上进行了测试,结果表明,推理电路参与度较低的数据在GSM8K和OlympiadBench等基准测试中表现更好。

  13. RESEARCH · CL_244570 ·

    新的 DATPO 方法增强了大型推理模型的推理覆盖范围

    研究人员开发了一种新的 DATPO 方法,以提高使用可验证奖励强化学习 (RLVR) 训练的大型推理模型的推理能力。DATPO 通过优化训练 rollout 来解决 RLVR 在扩展内在推理覆盖范围 (pass@k) 方面的局限性。该方法结合了自适应难度树搜索和句子熵引导的分叉,以最大化语义多样性并克服局部化问题,在数学推理基准测试中优于现有方法。

  14. TOOL · CL_247376 ·

    CARDEA模型为冠状动脉造影提供可审计推理

    研究人员开发了CARDEA,这是一种新颖的视觉语言模型,专为端到端的冠状动脉造影解读而设计。CARDEA采用链式盒子推理方法和可验证奖励的强化学习,以提供可审计的诊断结论。该方法旨在通过使模型的决策过程透明化和可解释化来增强临床医生的信任,解决了当前AI系统通常充当黑箱的局限性。

  15. TOOL · CL_241534 ·

    Cliff策略通过奖励第一个正确步骤来改进LLM推理

    研究人员引入了Cliff,一种用于大型语言模型中具有可验证奖励(RLVR)的强化学习的新型奖励塑造策略。Cliff通过关注中间推理过程,解决了现有方法依赖粗略结果奖励的局限性。该策略识别模型推理过程中的第一个错误,并利用此信号提供token级别的优势,奖励正确的词缀并惩罚后续的错误。实验表明,与标准方法(如on-policy distillation和GRPO)相比,Cliff显著提高了推理性能。

  16. TOOL · CL_231559 ·

    新的GAPO方法通过调整裁剪边界来改进强化学习

    研究人员推出了一种名为Group Adaptive Clipping Policy Optimization (GAPO) 的新方法,旨在通过可验证的奖励来增强强化学习。传统方法使用固定的裁剪边界,这可能不成比例地压制来自困难问题上罕见的正确滚动的宝贵学习信号。GAPO通过根据滚动优势动态调整裁剪边界来解决这个问题,从而为具有更高学习潜力的信号提供更大的更新空间。这种方法与现有的PPO/GSPO代理无缝集成,在Qwen和Llama模型…

  17. RESEARCH · CL_233133 ·

    Cliff 方法通过奖励正确的前缀来改进 LLM 推理

    研究人员推出了一种名为 Cliff 的新颖奖励塑造策略,用于大型语言模型中的可验证奖励强化学习 (RLVR)。Cliff 利用现成的语言模型来精确定位推理过程中的第一个错误,从而将生成过程划分为一个正确的前缀和一个不正确的后缀。这种方法将信号转换为 token 级优势,提供了比传统基于结果的奖励更精细化的反馈。实验表明,Cliff 显著提高了推理性能,优于现有的方法,如 On-Policy Distillation 和 GRPO。

  18. RESEARCH · CL_229181 ·

    新的 OPSA 方法质疑 on-policy distillation 的有效性

    研究人员质疑了 on-policy distillation (OPD) 在大型语言模型中的有效性,发现其监督可能存在噪声,并且学生模型对这种噪声基本不敏感。OPD 的收益似乎源于抑制低概率 token,而非直接的教师指导。这促使了 On-Policy Self-Adaptation (OPSA) 的开发,这是一种新的无监督方法,利用熵自适应负优势来提高模型性能。OPSA 显著提升了推理能力,在 AIME24 等基准测试中表现优于 OPD。

  19. TOOL · CL_218999 ·

    新的CBPO方法通过细粒度信用分配增强AI工具交互

    研究人员推出了一种新颖的强化学习方法——对比分支策略优化(CBPO),该方法具有可验证的奖励。该技术旨在通过对中间决策提供更细粒度的反馈,来改进语言模型与外部工具交互的学习方式。CBPO将rollout预算的分配与结果到token级别信用的转换分离开来,利用生成熵和路径级别衰减来管理探索。引入了对比分支值(CBV)来估计局部决策敏感性,从而无需过程级别注释即可实现细粒度信用分配。在十个基准测试中的实验表明,CBPO在数学推理和知识密集…

  20. RESEARCH · CL_204007 ·

    苹果研究探索GRPO在多语言LLM推理中的应用

    来自Apple Inc.和Hasso Plattner Institute的研究人员对非英语和多语言环境下的Group Relative Policy Optimization (GRPO) 进行了大规模研究。他们的发现表明,训练LLM用其母语进行推理,其性能接近基于英语的推理,并观察到了显著的跨语言迁移。然而,该研究也强调,这些趋势高度依赖于特定的模型和语言,并且在一门语言中的训练有时会导致其他语言的性能下降,因此需要进行广泛的评估。