研究人员质疑了 on-policy distillation (OPD) 在大型语言模型中的有效性,发现其监督可能存在噪声,并且学生模型对这种噪声基本不敏感。OPD 的收益似乎源于抑制低概率 token,而非直接的教师指导。这促使了 On-Policy Self-Adaptation (OPSA) 的开发,这是一种新的无监督方法,利用熵自适应负优势来提高模型性能。OPSA 显著提升了推理能力,在 AIME24 等基准测试中表现优于 OPD。 AI
影响 提出了一种更有效、无监督的改进 LLM 推理的方法,可能减少对噪声教师模型的依赖。
排序理由 提出新方法并分析现有方法的学术论文。
在 Hugging Face Daily Papers 阅读 →
- AIME24
- arXiv
- Hugging Face
- On-Policy Distillation
- On-Policy Self-Adaptation
- Qwen3-1.7B
- Qwen3-4B-OPSA
- Reinforcement Learning with Verifiable Rewards
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →