研究人员推出了一种名为“标准蒸馏策略优化”(Criterion-Distilled Policy Optimization, CriPO)的新方法,用于增强基于规则的强化学习(RL)在大型语言模型(LLMs)中的应用。CriPO解决了两个关键限制:未探索标准(Unexplored Criteria, UC),即没有一个生成结果满足给定标准;以及被抑制的标准(Suppressed Criteria, SC),即在优化过程中学习信号丢失。通过采用同策略自蒸馏,CriPO构建了一个自教师来注入UC缺失的行为,并使用反事实自教师来保留负优势生成结果中有用的模式,以解决SC问题。在医学和科学基准测试上的实验表明,CriPO的表现优于现有的基于规则的强化学习方法,在约一半的优化步数内取得了更好的性能。 AI
影响 这项研究通过改进探索和学习信号的利用,有望实现更高效、更有效的复杂开放式任务的大型语言模型训练。
排序理由 该项目是一篇学术论文,详细介绍了一种增强大型语言模型中强化学习的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Criterion-Distilled Policy Optimization
- Hugging Face
- KL loss
- Rubric-based RL
- Suppressed Criteria
- Unexplored Criteria
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →