研究人员开发了 ThinkPrior,一种用于在可验证奖励强化学习 (RLVR) 中优化提示选择的新方法。该方法旨在通过在首次训练 rollout 之前创建难度先验来减少计算资源的浪费,这与需要初始 rollout 来估计难度的传统方法不同。ThinkPrior 利用外部锚点传递来建立此先验,然后根据训练结果进行更新。在 Qwen2.5-Math-7B 模型上的实验表明,ThinkPrior 在不影响最终准确性的情况下,显著减少了早期沉默组和无效 rollout。 AI
影响 减少 RL 训练中的计算浪费,可能加速研发周期。
排序理由 关于 RLVR 新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →