PulseAugur
实时 04:23:38
实体 RLVR

RLVR

PulseAugur coverage of RLVR — every cluster mentioning RLVR across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
19
90 天内 71
发布 · 30天
0
90 天内 0
论文 · 30天
16
90 天内 66
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-03 research_milestone A new paper introduces a method to address forgetting in RLVR for LLMs. 来源
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/4 页 · 共 71 条
  1. TOOL · CL_208454 ·

    新的RLVR方法使用基于图的难度估计来优化LLM

    研究人员开发了一种新颖的基于图的在线难度估计器,旨在提高大型语言模型(LLM)的可验证奖励强化学习(RLVR)的效率。该方法通过动态估计样本难度而不要求额外的探测来解决均匀探索预算的低效率问题。通过构建语义相似性图并采用Potts先验,该系统鼓励相关样本共享难度状态,从而缓解了冷启动和陈旧反馈等问题。实验表明,该方法在各种模型和基准测试中都提高了性能。

  2. RESEARCH · CL_204007 ·

    苹果研究探索GRPO在多语言LLM推理中的应用

    来自Apple Inc.和Hasso Plattner Institute的研究人员对非英语和多语言环境下的Group Relative Policy Optimization (GRPO) 进行了大规模研究。他们的发现表明,训练LLM用其母语进行推理,其性能接近基于英语的推理,并观察到了显著的跨语言迁移。然而,该研究也强调,这些趋势高度依赖于特定的模型和语言,并且在一门语言中的训练有时会导致其他语言的性能下降,因此需要进行广泛的评估。

  3. COMMENTARY · CL_201990 ·

    AI 安全辩论:递归自我改进与对齐担忧

    Zvi Mowshowitz 分析了 Dwarkesh Patel 和 Ryan Greenblatt 讨论 AI 递归自我改进(RSI)的播客。Mowshowitz 认为 AI 研发可能导致快速、可能失调的进步,这与 Patel 对 AI 超越训练数据进行创新的能力持怀疑态度形成对比。讨论以 OpenAI 和 Anthropic 近期的 AI 安全事件为背景,以供辩论参考。

  4. TOOL · CL_198331 ·

    新的 Omni-Persona 基准测试评估全模态 LLM 个性化

    研究人员推出了 Omni-Persona,这是一个新颖的基准测试,旨在系统地评估和改进大型语言模型中的全模态个性化。该基准测试通过涵盖文本、图像和音频模态,并引入新的指标 Calibrated Accuracy (Cal) 来评估正确对齐和适当弃权,即使在无个性化场景下,也解决了现有研究的局限性。实验揭示了开放权重模型中显著的音频与视觉对齐差距,RLVR 在一定程度上缓解了这个问题,同时还强调了召回率和模型规模不足以诊断个性化质量,因…

  5. TOOL · CL_197191 ·

    AllenAI 教程详细介绍使用 SFT、DPO 和 RLVR 对 Tulu 3 进行后训练

    AllenAI 发布了一个教程,详细介绍了如何使用其 Open Instruct 框架对紧凑型指令微调语言模型进行后训练。该过程涉及三个主要阶段:监督微调 (SFT)、直接偏好优化 (DPO) 和使用 GRPO 的可验证奖励强化学习 (RLVR)。该教程通过用轻量级的 Hugging Face 和 PyTorch 实现替换分布式组件,将 Tulu 3 堆栈适配到 16 GB 运行时。它涵盖了数据准备、LoRA 适配器配置以及使用确定性…

  6. TOOL · CL_196030 ·

    CuSearch框架通过课程采样增强了基于代理的检索增强生成(RAG)训练

    研究人员开发了CuSearch,一个使用带可验证奖励的强化学习(RLVR)来训练基于代理的检索增强生成(RAG)系统的新框架。该方法通过优先考虑提供更具信息量监督的更深搜索轨迹来解决轨迹均匀采样的问题。CuSearch利用搜索深度贪婪分配(SDGA)将更新预算动态地分配给这些更深的轨迹,从而提高了性能。实验表明,在ZeroSearch基准测试上,相比标准的GRPO,精确匹配点数提高了11.8点。

  7. RESEARCH · CL_195833 ·

    新的MISA-T策略提高了LLM的RL rollout效率

    研究人员开发了MISA-T,这是一种新的路由层准入策略,旨在优化大型语言模型(LLM)的混合强化学习(RL)rollout调度。该策略解决了不同RL范式(如RLVR和RLHF)争夺KV缓存容量的异构服务需求带来的挑战。MISA-T通过智能管理会话准入、KV容量分配和KV核算,同时保持指定的混合工作负载和任务分数,从而提高了rollout吞吐量并缩短了迭代时间。

  8. TOOL · CL_204316 ·

    新的RLVR方法增强了多模态LLM在提示变化下的鲁棒性

    研究人员开发了一种名为提示不变RLVR(PIRL)的新方法,以提高多模态大语言模型(MLLMs)在使用可验证奖励强化学习(RLVR)时的鲁棒性。标准的RLVR方法很脆弱,提示的微小变化会显著降低性能,这对于高风险应用来说是个问题。PIRL通过在奖励信号中分离内容和格式,并训练模型对语义等价的提示变化保持不变来解决这个问题。与GRPO等现有方法相比,这种方法在压力测试和动态评估下表现出显著更好的性能。

  9. RESEARCH · CL_193290 ·

    新研究解决大语言模型推理、可靠性和可解释性问题

    近期研究探索了提高大语言模型(LLMs)推理能力和可靠性的方法。论文引入了行为提升(Behavioral Lift)等新指标来量化推理行为,并识别出放大提升差距(Amplification-Lift Gap),表明训练应侧重于校准和基于事实的推理。其他工作提出了感知-纠正蒸馏(Perception-Correction Distillation)等技术来解决多模态推理中的失败问题,以及 SheetCompass 通过模拟结构关系来增强…

  10. TOOL · CL_185393 ·

    RingSQL框架生成合成数据以增强文本到SQL模型

    研究人员开发了RingSQL,一个用于生成合成问题-SQL对以改进文本到SQL模型的新型混合框架。该方法结合了模式无关的查询模板和基于LLM的问题释义,确保正确性的同时扩展数据生成。RingSQL的合成数据集在RLVR训练中表现出改进的性能,在Spider和BIRD等基准测试中达到了69.8%的平均准确率,并优于现有的合成数据集和人工标注数据。

  11. TOOL · CL_178755 ·

    统一的 RLVR 算法 GRPO、Dr. GRPO 和 DAPO 详解

    伊利诺伊大学厄巴纳-香槟分校 Bay 和 Yearick 的一篇新论文揭示,GRPO、Dr. GRPO 和 DAPO 在单一算法下得到统一,仅在处理组内奖励标准差(σ)方面有所不同。该论文提供了精确的公式来阐明每种变体何时最有效。GRPO 除以 σ 会放大简单和困难问题的梯度,而 Dr. GRPO 使用 σ 进行自然难度加权。DAPO 通过丢弃 σ 为零的批次来优化计算,这在困难问题中很常见。

  12. RESEARCH · CL_180478 ·

    新方法RSTG通过自适应教师指导改进LLM强化学习

    研究人员开发了RSTG(Recovering Learning Signals via Adaptive Teacher Guidance,通过自适应教师指导恢复学习信号),一种改进大型语言模型强化学习的新方法。现有的GRPO等方法在稀疏奖励方面存在困难,而与在线蒸馏(OPD)的简单组合可能会降低性能。RSTG选择性地将蒸馏应用于负面提示,根据教师的置信度对样本进行加权,并针对特定标记进行蒸馏。它还通过注入正梯度来纳入教师生成的轨迹上…

  13. TOOL · CL_171874 ·

    新的 SARA 方法通过自适应回滚分配提高了 RLVR 效率

    研究人员开发了一种名为顺序自适应回滚分配 (SARA) 的新方法,以提高具有可验证奖励的强化学习 (RLVR) 的效率。SARA 通过使用 Beta 后验来跟踪成功率和类似 SPRT 的规则来提前放弃无效组,从而解决了在已确定完全正确或不正确的提示上浪费回滚的问题。这种方法将节省的预算重新分配给新提示,从而节省大量回滚并提高准确性,尤其是在与动态采样等现有方法结合使用时。

  14. TOOL · CL_168733 ·

    AI监管新愿景:基于实验训练的基础模型

    Jacob Steinhardt 提出了一种通过开发专门的基础模型来进行 AI 模型监管的新方法。该监管模型将基于在“主题模型”上进行的实验海量数据集进行训练,然后使用基于验证监管的强化学习 (RLVR) 任务进行优化。最终目标是创建一个 AI 助手,能够将监管问题形式化为可测试的标准,生成相关数据,并提供关于主题模型行为的可靠答案,例如识别“沙袋效应”或奖励黑客行为。

  15. TOOL · CL_167205 ·

    研究发现大型语言模型任务适应会显著改变对齐

    一项发表在arXiv上的新研究调查了将大型语言模型(LLMs)适应特定任务如何影响其与安全和道德准则的对齐。研究人员评估了监督微调(SFT)和可验证奖励强化学习(RLVR)等方法,发现RLVR引起的对齐变化最小,而SFT在安全、事实性和社会危害等多个领域导致显著的行为和表征漂移。研究强调,在大型语言模型的训练后过程中,需要进行多维度的对齐评估作为标准。

  16. RESEARCH · CL_169744 ·

    新的AI方法训练模型以实现高效代码生成 · 已追踪2个来源

    研究人员开发了新的方法来训练AI模型,使其不仅能生成正确的代码,还能生成高效的代码。一种方法RLPF(来自性能反馈的强化学习)使用分阶段的奖励系统,该系统优先考虑程序的执行进度而非正确性,然后按效率对正确程序进行排名。该方法在应用于Qwen3-32B时,显著提高了正确且可运行解决方案的生成及其相对效率。另一项研究侧重于通过改进代码的测试方式以及速度如何转化为奖励,来克服将强化学习应用于代码优化时遇到的挑战,例如测量噪声和奖励稀疏性。这…

  17. RESEARCH · CL_175929 ·

    新的RLSVR方法将LLM的自我改进扩展到开放式任务 · 跟踪 4 个来源

    研究人员开发了具有可验证奖励的强化学习(RLSVR),这是一种新的训练范式,将具有可验证奖励的强化学习(RLVR)的应用扩展到开放式任务。传统的RLVR仅限于数学和编码等易于验证正确性的领域。RLSVR将开放式任务转化为可验证的代理环境,利用SpyRL多智能体游戏等机制生成自动奖励信号。实验表明,这种方法在文本摘要和创意写作等任务上提高了性能,同时在可验证推理任务上也取得了进步。

  18. COMMENTARY · CL_162034 ·

    分析表明,LLM 的能力主要源于模仿学习,而非强化学习

    一项近期分析认为,大型语言模型(LLM)的能力主要来源于模仿学习,例如预训练和监督微调,而非强化学习(RL)。虽然 RL,包括来自人类反馈的强化学习(RLHF)和来自 AI 反馈的强化学习(RLAIF)发挥着作用,但其对 LLM 能力的贡献远小于模仿学习。这一观点表明,RL 在传授能力方面的效率比模仿学习低几个数量级,这影响了我们对模型可解释性和对齐的理解。

  19. TOOL · CL_160729 ·

    新研究识别RLVR中的pass@k反转,并提出缓解策略

    一篇新的研究论文探讨了在可验证奖励强化学习(RLVR)中出现的“pass@k反转”现象。当RLVR提高模型单样本准确率,但降低其在需要多次尝试(更高k)的任务上的表现时,就会发生这种情况。该论文认为这是由于证据缺失导致的失败,即在RLVR训练过程中,稀有的正确轨迹会丢失。一种名为“逐问题基准锚定”(PBA)的提议方法,旨在通过优化提示并根据基准模型的分布锚定高风险提示来缓解这一问题,并在Omni-MATH-Test等基准测试中取得了改进的结果。

  20. RESEARCH · CL_158788 ·

    Trace环境提升视觉语言模型推理性能

    研究人员开发了Trace,一个旨在提高语言模型视觉推理能力的新环境。该环境利用场景语法和可执行任务程序生成跨越11个领域的1000个不同的视觉推理任务,以创建可验证和可复现的训练数据。当应用于Qwen2.5-VL模型时,在Trace实例上进行训练带来了显著的性能提升,其中Qwen2.5-VL-7B在24个基准测试的宏平均性能上提高了4.06个百分点。