PulseAugur
实时 17:56:49
English(EN) Enhancing Rubric-based RL via Self-Distillation

新的强化学习方法CriPO增强了大型语言模型的探索和学习信号

研究人员推出了一种名为“标准蒸馏策略优化”(Criterion-Distilled Policy Optimization, CriPO)的新方法,用于增强基于规则的强化学习(RL)在大型语言模型(LLMs)中的应用。CriPO解决了两个关键限制:未探索标准(Unexplored Criteria, UC),即没有一个生成结果满足给定标准;以及被抑制的标准(Suppressed Criteria, SC),即在优化过程中学习信号丢失。通过采用同策略自蒸馏,CriPO构建了一个自教师来注入UC缺失的行为,并使用反事实自教师来保留负优势生成结果中有用的模式,以解决SC问题。在医学和科学基准测试上的实验表明,CriPO的表现优于现有的基于规则的强化学习方法,在约一半的优化步数内取得了更好的性能。 AI

影响 这项研究通过改进探索和学习信号的利用,有望实现更高效、更有效的复杂开放式任务的大型语言模型训练。

排序理由 该项目是一篇学术论文,详细介绍了一种增强大型语言模型中强化学习的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的强化学习方法CriPO增强了大型语言模型的探索和学习信号

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang ·

    通过自蒸馏增强基于规则的强化学习

    arXiv:2607.18082v1 Announce Type: cross Abstract: Rubric-based RL has recently shown promise in improving LLMs on open-ended tasks. A widely recognized limitation of rubric-based RL is limited exploration: criteria that no rollout manages to satisfy (Unexplored Criteria, UC) rece…