PulseAugur
实时 10:31:33

新的PAIR方法优化RLVR计算分配

研究人员开发了一种名为PAIR(Pairwise-Aware Inclusion Reweighting)的新方法,用于优化可验证奖励强化学习(RLVR)中的计算资源分配。该方法通过考虑不同推理轨迹之间的成对关系,而不是独立处理它们,来解决现有分配器中的统计不匹配问题。PAIR将这些关系建模为一个对比图,并使用仅前缀预测器来估计正确性和成本,与之前在Qwen3模型上的方法相比,提高了准确性并显著减少了生成的token数量。 AI

影响 这种新方法可以显著降低训练高级RL模型的计算成本,从而可能加速需要复杂推理的领域的研究和开发。

排序理由 该集群包含一篇研究论文,详细介绍了优化RLVR计算分配的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的PAIR方法优化RLVR计算分配

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes ·

    PAIR:用于RLVR中自适应推广分配的成对感知包含重加权

    arXiv:2608.11368v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards (RLVR) spends most of its compute generating groups of long reasoning trajectories. Recent allocators reduce this cost by assigning budgets to prompts, rollouts, or tokens according to …