DAPO++
PulseAugur coverage of DAPO++ — every cluster mentioning DAPO++ across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究发现:AI 模型在未见过的任务上会陷入“泛化陷阱”
本文详细介绍了多奖励强化学习基准测试的第二部分,重点关注不同算法在未见过的任务上的表现。该研究在去中心化交易所套利环境中,使用 Qwen3-14B 模型测试了包括 CISPO 和 DAPO 在内的七种强化学习算法。结果显示,尽管 CISPO 获得了很高的训练奖励,但其在冻结测试任务上的表现与未经训练的基线模型相比显著下降,突显了潜在的“泛化陷阱”,即训练指标可能具有误导性。
-
Qwen3 14B 模型实验比较强化学习技术 · 跟踪 2 个来源
对 Qwen3 14B 模型进行了实验,以评估各种强化学习技术,包括 GRPO、DAPO++、CISPO、Adapoides 和 REPO-RECK。该研究侧重于比较这些方法是否包含“思考”组件,并展示了完整的留存结果、奖励曲线和资源使用数据。研究还涉及了网络抓取和多账户管理等高风险自动化任务。
-
VideoScout 代理学习自适应节奏以理解长视频
研究人员推出 VideoScout,这是一种采用顺序证据获取 (SEA) 范式来理解长视频的代理。该方法使代理能够调整其观看节奏、保留关键证据、重新访问不确定的片段,并有效地确定何时回答。VideoScout-66K 是一个包含超过 66,000 个探索回合的数据集,用于通过涉及监督微调和具有复合奖励的轨迹级强化学习的两阶段流程来训练代理。
-
ThinkPrior 方法优化 RLVR 提示选择,减少无效 rollout
研究人员开发了 ThinkPrior,一种用于在可验证奖励强化学习 (RLVR) 中优化提示选择的新方法。该方法旨在通过在首次训练 rollout 之前创建难度先验来减少计算资源的浪费,这与需要初始 rollout 来估计难度的传统方法不同。ThinkPrior 利用外部锚点传递来建立此先验,然后根据训练结果进行更新。在 Qwen2.5-Math-7B 模型上的实验表明,ThinkPrior 在不影响最终准确性的情况下,显著减少了早期…
-
LLM 微调方法:SFT、LoRA、QLoRA、RFT 和蒸馏法详解
本文概述了微调大型语言模型的各种方法,重点关注实际应用和工具选择。监督微调(SFT)被介绍为起点,需要有标签的输入-输出对。LoRA 和 QLoRA 被讨论为高效的替代方案,它们训练适配器权重而不是整个模型,其中 Unsloth 被指出可以加速这些过程。强化微调(RFT),特别是使用 GRPO 及其变体(如 DAPO++ 和 Dr.GRPO),推荐用于输出质量的判断比演示更容易的任务,例如代理行为。蒸馏法也被涵盖,作为一种将知识从大型…
-
ProRetrieval系统合成混合搜索程序,性能超越GPT-5.5和Claude Opus 4.7
研究人员开发了ProRetrieval,一个新颖的系统,通过合成可执行程序来编排混合搜索查询。该系统结合了用于结构化数据的SQL运算符和用于文本和图像的向量检索,并使用SQL作为逻辑代数来融合结果。在评估中,使用Qwen3-4B(带有GRPO和DAPO)的ProRetrieval模型在新派生的亚马逊产品和Enron电子邮件基准测试中,性能优于GPT-5.5和Claude Opus 4.7。
-
ProRetrieval系统合成混合搜索程序,性能超越GPT-5.5和Claude Opus 4.7
研究人员开发了ProRetrieval,一个新颖的系统,通过合成可执行程序来编排混合搜索查询。该系统将结构化查询运算符与向量检索原语相结合,实现了文本和图像搜索的复杂逻辑组合。ProRetrieval使用Qwen3-4B配合GRPO和DAPO进行训练,并在源自亚马逊产品和Enron邮件的新基准测试中表现出色,性能超越了GPT-5.5和Claude Opus 4.7等模型。
-
新 GCPO 方法增强 LLM 训练稳定性和性能
研究人员推出了一种名为 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化)的新方法,旨在通过在线滚动方法改进大型语言模型(LLM)在训练后阶段的稳定性和性能。该技术通过将策略更新约束在特定的子空间内,防止性能下降的偏差,从而解决了训练不稳定性以及能力退化等问题。在 Qwen3-8B 和 GLM4-9B 模型上的实验表明,GCPO 的表现优于 GRPO 和 DAPO …
-
TriCLE系统使用三模态推理进行基于边缘的飞机聚类
研究人员开发了TriCLE,一个新颖的三模态视觉-语言系统,专为边缘设备上的细粒度飞机聚类而设计。该系统从单个RGB图像生成伪热成像和伪LiDAR视图,并使用Qwen3-VL骨干网络将其与任务指令融合。TriCLE与专家飞机分类法对齐,使其能够根据与工程相关的相似性对飞机进行分组,而不仅仅是视觉外观。该模型经过4位量化和优化后,符合8GB的部署目标,并能高效处理数据,证明了其在基于边缘的航空观测中的实用性。
-
CARE-X VLM 通过集成诊断和测量工具增强放射学报告
研究人员开发了 CARE-X,这是一种新颖的视觉语言模型 (VLM),旨在提高放射学报告的临床实用性。CARE-X 将辅助判别和定位头与其生成主干集成,增强了诊断预测和空间准确性。该模型还采用了解耦的 Clip 和动态采样策略优化 (DAPO) 方法,使用特定任务的奖励信号来优化报告生成和视觉问答。此外,CARE-X 集成了 Qwen3-VL-4B-Instruct 模型的工具调用能力,以执行精确的解剖测量,其性能明显优于仅感知基线。
-
统一的 RLVR 算法 GRPO、Dr. GRPO 和 DAPO 详解
伊利诺伊大学厄巴纳-香槟分校 Bay 和 Yearick 的一篇新论文揭示,GRPO、Dr. GRPO 和 DAPO 在单一算法下得到统一,仅在处理组内奖励标准差(σ)方面有所不同。该论文提供了精确的公式来阐明每种变体何时最有效。GRPO 除以 σ 会放大简单和困难问题的梯度,而 Dr. GRPO 使用 σ 进行自然难度加权。DAPO 通过丢弃 σ 为零的批次来优化计算,这在困难问题中很常见。
-
新的ReDiPPO框架提升LLM数学推理能力
研究人员推出了一种名为ReDiPPO的新型框架,旨在增强大型语言模型(LLM)的数学推理能力。该方法解决了数学任务中准确的令牌级信用分配的挑战,这些任务通常具有长推理链和稀疏奖励。ReDiPPO采用参考引导的评论家,利用参考答案进行更精确的值估计,并量化标准和参考引导估计之间的差异,以便在策略优化期间重新加权令牌优势。实验表明,ReDiPPO在数学推理性能上超越了PPO、DAPO和GSPO等现有方法。
-
TalTech 系统凭借新颖的语音到 SOAP 笔记生成技术赢得 Beyond Transcription 挑战赛
爱沙尼亚塔林理工大学(TalTech)的研究人员为 Beyond Transcription Challenge(BeTraC)开发了系统,该挑战赛旨在直接从医生-患者对话生成 SOAP 笔记,无需中间转录。他们改编的模型 Voxtral Mini 和 Voxtral Small,利用 LoRA 微调和 DAPO 强化学习,并以 Open Medical Concept F1 指标进行评估。这些系统在挑战赛的轻量级和重量级赛道中均获得…
-
SIVA-RL框架通过将预测与视觉证据联系起来,增强了多模态推理能力
研究人员推出了一种新颖的SIVA-RL框架,旨在通过确保视觉语言模型将其预测与视觉证据联系起来,来改进多模态强化学习。与依赖干预类型的先前方法不同,SIVA-RL使用样本级、结果条件化的监督来使模型行为与观察到的效果保持一致。这种方法与GRPO和DAPO骨干兼容,在九个多模态推理基准测试中显示出显著的改进,将视觉依赖推理提高了8.79个百分点,整体相对改进高达14.9%。
-
新的UP目标通过平衡探索与稳定性来增强LLM推理能力
研究人员推出了一种名为“无界正向非对称优化”(Unbounded Positive Asymmetric Optimization, UP)的新型目标函数,旨在改进大型语言模型(LLMs)的强化学习(RL)。UP通过允许正向优势的梯度无限制,从而增强探索,同时保持对负向优势的梯度裁剪,以防止训练不稳定,从而解决了当前RL框架中固有的探索-稳定性困境。这种即插即用的目标函数已在各种RL算法、模型架构和训练模式中展现出提高推理准确性的能力。
-
新的ACPO框架增强了大型语言模型的强化学习能力
研究人员推出了一种名为自适应信用策略优化(ACPO)的新框架,旨在改进大型语言模型强化学习中的信用分配。ACPO通过不对称地调整策略更新来解决稀疏奖励的挑战,重点关注成功试验中的不确定决策和失败试验中的过度自信的token。该方法旨在在保持策略梯度方向的同时,提高在AIME 2025和HumanEvalPro等基准测试上的性能,优于DAPO、GTPO和SAPO等现有方法。
-
新恒等式统一三种语言模型训练方法
一篇新论文介绍了分组标准差恒等式(Group-Standard-Deviation Identity),证明了三种流行的语言模型训练方法——GRPO、Dr. GRPO 和 DAPO——本质上是对单个参数的调整:采样答案分歧的标准差。该恒等式揭示了标准差直接与训练更新的大小相关,一致同意不产生学习,而答案分歧则提供最重要的训练信号。研究通过 Big-Math 数据集和受控训练运行验证了这些发现,强调了该参数在决定学习效果和重点方面的关键作用。
-
新的CFPO框架增强了LVLM的多模态推理能力
研究人员推出了一种名为逆事实策略优化(CFPO)的新框架,旨在提高大型视觉语言模型(LVLM)的多模态推理能力。CFPO通过强制视觉感知与文本推理之间的因果一致性来解决基础性失败和幻觉漂移问题。该方法与GRPO和DAPO等现有算法集成,无需额外的监督或奖励模型。实验表明,CFPO显著提高了推理保真度,优于标准的RL基线和当前最先进的感知感知方法。
-
新的RLVR方法ACPO增强了LLM的推理能力
研究人员分析了来自可验证奖励的强化学习(RLVR),以了解其对大型语言模型推理的影响。他们的理论分析表明,由每次rollout的梯度步数影响的离策略学习程度,通过影响重要性采样比率和裁剪行为,显著改变了更新动态。基于此,他们提出了自适应裁剪策略优化(ACPO),该方法动态调整裁剪边界。实验表明,ACPO在使用3B和7B模型进行的各种推理任务上优于DAPO和CISPO等现有方法。
-
新的DUPL方法提升了LLM的多模态推理能力
研究人员推出了一种新颖的策略学习方法DUPL,旨在增强大型语言模型(LLMs)的多模态推理能力。该方法专门解决了区分复杂推理产生的不确定性与视觉感知模糊性之间的挑战。通过量化和利用感知不确定性和输出不确定性,DUPL指导策略更新,将学习重点放在高模糊性区域,从而改善了目标探索。该方法在各种多模态推理基准测试中显示出显著的准确性提升,优于现有方法,并展示了在不同算法和架构上的广泛适用性。