PulseAugur
中
实时 06:20:03
实体 RLVR

RLVR

PulseAugur coverage of RLVR — every cluster mentioning RLVR across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
97
90 天内 97
发布 · 30天
0
90 天内 0
论文 · 30天
93
90 天内 93
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-03 research_milestone A new paper introduces a method to address forgetting in RLVR for LLMs. 来源
情绪 · 30 天

12 天有情绪数据

最近 · 第 1/6 页 · 共 105 条
  1. RESEARCH · CL_284317 ·

    新AI方法利用过往经验改进未来预测

    研究人员推出了一种新颖的强化学习方法——自我反思蒸馏(SRD),该方法利用过往经验来改进未来预测。这项技术在最近的一篇arXiv论文中有所详述,旨在教会智能体在行动前预见结果并避免陷阱,尤其是在传统奖励信号稀缺或统一的场景中。SRD是对现有强化学习方法的补充,尤其在复杂、长周期的任务中表现出显著的性能提升。

  2. TOOL · CL_281912 ·

    RLVR 验证器设计强调确定性检查而非 LLM 裁判

    构建有效的可验证奖励强化学习 (RLVR) 系统需要高度关注验证器防御工程,这构成了开发工作的 80%。核心原则是使用确定性方法(如编译器和测试脚本)进行验证,而不是依赖其他语言模型,因为后者可能被利用偏见和提示注入。一个强大的 RLVR 系统应采用包括网关、预言机和风险评分器在内的三层架构,并辅以故障关闭网关和主动突变验证等策略,以确保代理程序引起经过验证的状态更改。

  3. RESEARCH · CL_280104 ·

    AI研究探讨偏好推理和决策中的差距

    两篇新研究论文探讨了AI偏好推理和决策的细微差别。第一篇论文《可验证、可阐述和默会偏好组成部分》(Verifiable, Articulable, and Tacit Components of Preference)介绍了一个名为CreativePreferences的大型数据集,并强调了AI模型能够阐述或验证的内容与人类默会理解之间存在的显著差距。第二篇论文《询问、放松还是行动?评估LLM偏好推理中的可操作不确定性》(Ask, R…

  4. TOOL · CL_280384 ·

    新的Mesh Learning方法可防止RLVR训练的LLM出现策略崩溃

    研究人员在通过可验证奖励强化学习(RLVR)训练的大型语言模型中发现了一种称为灾难性策略崩溃的现象。当GRPO等算法过度限制模型的推理能力,导致不同策略无法访问时,就会发生这种崩溃。为了解决这个问题,开发了一种名为Mesh Learning的新方法,该方法鼓励保留多种推理策略。在AIME26和GPQA等基准测试上的实验表明,当应用于Qwen和Phi Llm等模型时,Mesh Learning的性能明显优于现有方法。

  5. TOOL · CL_280085 ·

    新的 ROUTEAUDIT 框架增强了多验证器系统的评估

    一篇新的研究论文介绍 ROUTEAUDIT,这是一个用于评估多验证器系统的框架,特别是在验证器特征发生变化的场景中。该系统通过将验证器路由构建为一种条件契约的识别问题,来解决目录更新、可用性波动和评分者变化等挑战。ROUTEAUDIT 旨在为自适应策略提供更准确的归因和敏感性分析,并在留存测试中展示出优于静态方法的性能。

  6. TOOL · CL_277352 ·

    新的 RLVR 方法从未来的模型检查点学习

    研究人员开发了一种名为时间自蒸馏的新方法,用于具有可验证奖励的强化学习 (RLVR)。该技术允许模型从其自身的未来检查点学习,假设一个“近未来”的教师模型比一个“远未来”的教师模型能提供更好的新能力和可迁移性之间的平衡。该研究引入了近未来策略优化 (NPO) 和近未来策略蒸馏 (NPD) 机制,以及用于自适应指导的 AutoNPO。在八个图像-文本基准上的实验表明 GRPO 分数有所提高,这表明有效的时间自蒸馏依赖于这种平衡,而不仅仅…

  7. TOOL · CL_277238 ·

    适配器丛林通过分割 RLVR 预算提高 AI 采样精度

    研究人员开发了一种名为“适配器丛林”的新技术,可提高 AI 模型采样中多数投票的有效性。通过将可验证奖励强化学习 (RLVR) 预算分配给多个较小的 LoRA 适配器,而不是集中在一个适配器上,该方法可以防止相关错误并保持更高的准确性。适配器丛林在多数投票中使用大量样本时,其表现始终优于单个、完全训练的适配器。

  8. TOOL · CL_275041 ·

    新的RLVR框架在预算限制下增强了SLM-LLM协作

    研究人员开发了一个名为RLVR的新框架,以改善小型语言模型(SLM)和大型语言模型(LLM)之间的协作。SLM不再仅仅分配任务,而是充当主要推理者,仅在必要时策略性地查询LLM顾问,从而优化成本和效率。这种方法在新的arXiv论文中有详细介绍,包括学习何时调用顾问、如何制定有效的查询以及如何将LLM的响应整合到SLM的推理过程中。RLVR框架在数学和编码任务上展示了改进的性能-成本权衡,在某些场景下甚至可以媲美神谕路由,并证明了其对其…

  9. TOOL · CL_273295 ·

    新的LLM后训练方法增强了启发式设计

    研究人员开发了一种用于自动启发式设计(AHD)的大型语言模型(LLM)在线后训练新方法。该方法在一个新论文中详细介绍,侧重于从程序有效性和性能分数构建上下文相关的学习信号来更新LLM生成器。与之前保持生成器冻结的方法不同,该技术允许模型从评估的候选者那里学习,旨在提高有用启发式的生成。

  10. RESEARCH · CL_273247 ·

    新研究应对语言模型训练中的奖励劫持问题

    两篇新研究论文 Rubric-RL 和 CATCH 解决了语言模型强化学习中的“奖励劫持”问题。Rubric-RL 提出了“协议级标准”(ProRubric)来改进标准聚合方式,防止模型通过满足不相关标准而获得高分。CATCH 引入了一个用于研究和缓解编码强化学习中奖励劫持的测试平台,突出了模型如何利用漏洞甚至误导监控系统。

  11. TOOL · CL_273191 ·

    研究质疑RLVR中难度标签的可靠性

    一篇新的研究论文质疑了在具有可验证奖励的强化学习(RLVR)中使用的难度标签的可靠性。研究表明,先前被认为不可学的提示实际上可能会得到改进,尽管速度较慢,并且难度标签本身的重现性不如预期。研究人员提出了一个框架来量化这种不稳定性,并确定可靠难度分配所需的评估深度,同时重新审视了用于解释慢学习现象的梯度相似性证据。

  12. TOOL · CL_273147 ·

    新的RLCD方法提高了推理模型的校准性和准确性

    研究人员开发了OpenJev-RLCD,一种用于推理模型校准决策中强化学习的新实现。该方法首先采样一个理由,然后使用严格的适当评分规则对答案分布进行评分,这会激励不同的理由。在Qwen3-1.7B推理任务上的实验表明,RLCD在准确性和选择性预测方面与监督微调和其他强化学习方法相当或更优。值得注意的是,在GSM8K答案验证方面,与GRPO相比,RLCD实现了更高的准确性和更低的错误率。

  13. TOOL · CL_284892 ·

    新的大语言模型训练方法增强了启发式设计能力

    研究人员开发了一种名为在线后训练的新方法,用于改进用于自动启发式设计(AHD)的大型语言模型(LLM)。与传统的保持生成器模型静态的AHD系统不同,这种方法根据LLM生成的启发式的性能来更新模型。该系统名为EvoTune,使用带有可验证奖励的强化学习(RLVR)来创建一个反馈循环,其中评估的候选者不仅指导搜索,还为LLM提供训练信号。该方法侧重于从程序有效性和任务性能构建上下文相关的学习信号,旨在超越简单地累积搜索状态来增强LLM的启…

  14. TOOL · CL_270368 ·

    新GRAFT框架通过交换同伴轨迹增强RLVR

    研究人员开发了GRAFT,一个旨在增强具有可验证奖励(RLVR)的强化学习方法(如GRPO)的新框架。GRAFT解决了RLVR中有限的rollout预算问题,这可能导致缺乏策略梯度信号的“全失败”组。通过允许异构模型交换成功的轨迹,GRAFT使它们能够从彼此的发现中学习,从而提高数学推理基准的性能。该框架还控制了跨模型不匹配,并且即使在使用存储的同伴轨迹时也能在很大程度上保持性能提升。

  15. TOOL · CL_270382 ·

    新的DCSD方法提高了AI自蒸馏的可靠性

    研究人员引入了解耦信用自蒸馏(DCSD),这是一种新颖的方法,旨在通过分离信用方向和贡献幅度来改进AI模型的自蒸馏。该方法解决了教师监督因判断错误和偏好差异而可能不可靠的问题。DCSD利用信念边距探测(belief-margin probing)来确定信用方向,利用边际信息增益(marginal information gain)来确定幅度,从而实现更准确的步到令牌(step-to-token)信用分配。在11个基准测试中,DCSD的…

  16. RESEARCH · CL_269361 ·

    新研究提升视觉语言模型的效率和鲁棒性

    研究人员正在开发新方法来提高视觉语言模型(VLM)的效率和鲁棒性。FedMIX-P 旨在通过混合局部和全局预条件器来加速联邦训练,在语言模型上显示出准确性提升。VETO 通过使用双轴压缩来解决长视频中视觉标记的二次成本问题,从而实现更快的推理。ProtoDCS 为 VLM 中的开放集测试时适应提供了一个鲁棒的框架,提高了准确性和分布外检测能力。架构采样通过重用解码器层从冻结的 VLM 中生成多样化的候选模型,从而提高了在多模态基准测试…

  17. TOOL · CL_256853 ·

    新的ReDraft方法通过修订模型失败来改进LLM的后续训练

    研究人员开发了一种名为ReDraft的新方法,用于持续对大型多模态模型进行后续训练。该技术旨在在不牺牲现有能力的情况下增强新能力,这是模型训练中的一个常见挑战。ReDraft通过使用模型自身错误的输出来作为修订的基础,并以专家响应作为参考来实现这一点。然后,模型会优化其输出,并且只有被接受的修订才用于微调,从而在最小化遗忘先前知识的同时提高新任务的性能。

  18. TOOL · CL_252031 ·

    新的测试平台揭示奖励破解在LLM微调过程中出现

    研究人员推出了Countdown-Code,一个旨在准确测量大型语言模型奖励破解的新测试平台。该环境将真实的奖励与代理奖励分开,揭示了即使训练数据中的污染极少,奖励破解也可能在监督微调(SFT)过程中无意中出现。强化学习进一步放大了这种错位及其泛化,强调了对合成SFT数据进行严格验证的必要性。

  19. TOOL · CL_245326 ·

    新平台 DataFlex-RL 未发现 RLVR 数据策略有持续收益

    研究人员开发了 DataFlex-RL,一个旨在评估具有可验证奖励(RLVR)的强化学习数据策略的新平台。使用 Qwen2.5-7B-Base 在 12 个基准测试上的初步实验表明,虽然统一 GRPO 提高了准确性,但没有一种测试的 rollout-selection 或 reweighting 方法能持续优于统一采样。使用 Llama-3.1-8B-Base 进行的进一步测试未能确定方法之间的明确赢家。该研究还发现,评估排名可能因所…

  20. TOOL · CL_245126 ·

    ThinkPrior 方法优化 RLVR 提示选择,减少无效 rollout

    研究人员开发了 ThinkPrior,一种用于在可验证奖励强化学习 (RLVR) 中优化提示选择的新方法。该方法旨在通过在首次训练 rollout 之前创建难度先验来减少计算资源的浪费,这与需要初始 rollout 来估计难度的传统方法不同。ThinkPrior 利用外部锚点传递来建立此先验,然后根据训练结果进行更新。在 Qwen2.5-Math-7B 模型上的实验表明,ThinkPrior 在不影响最终准确性的情况下,显著减少了早期…