研究人员开发了一种名为单次采样近端策略优化(SR-PPO)的新方法,以解决语言模型强化学习中估计token级优势的挑战。该方法使用在每次提示的单次采样上训练的蒙特卡洛Pass@k评论员来改进信用分配并降低计算成本。该方法在HMMT26和AIME24等数学推理基准上显示出稳定的学习和持续的成功率提升。 AI
影响 这项研究通过降低强化学习的计算成本,可能导致更高效的语言模型训练。
排序理由 该集群包含一篇详细介绍语言模型强化学习新方法的论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →