研究人员推出了一种名为 RISE 的新方法,通过自我外推和策略蒸馏来改进语言模型。与依赖外部教师或有限的上下文内学习的先前方法不同,RISE 从模型自身的训练轨迹构建了一个合成教师。该合成教师通过外推模型的进展提供密集的、token 级别的监督。实验表明,在数学推理、STEM 和代码生成等各种任务上,RISE 的表现优于标准的人类反馈强化学习 (RLHF) 和同策略自我蒸馏。 AI
影响 这项新的自我外推技术可能带来更高效、更有效的语言模型训练,从而提高在复杂推理和生成任务上的性能。
排序理由 该集群包含一篇详细介绍改进语言模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- arXiv
- code generation
- mathematical reasoning
- multi-domain STEM
- multi-turn agentic tasks
- On-Policy Distillation
- policy distillation
- Recursive Improvement via Self-Extrapolating Policy Distillation
- RISE
- RLVR
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →