一项新的研究论文提出了一种名为 OPD-then-RL 的两阶段方法,用于提高大型语言模型的推理能力。该方法包括先进行策略内蒸馏 (OPD),然后进行可验证奖励强化学习 (RLVR),其性能始终优于在单个步骤中组合这些信号的方法。研究表明,OPD 首先扩展了模型对教师支持解决方案的理解,然后 RL 对这些解决方案进行优化。该论文还提供了一个实际指导方针,指出 OPD 验证分数是确定何时过渡到 RL 的关键指标,并且 OPD 比监督微调 (SFT) 更有效地作为 RL 的起点。 AI
影响 这项研究可能带来更有效的 LLM 训练技术,提高推理任务的性能。
排序理由 详细介绍 LLM 训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →