研究人员开发了一个统一的策略内自蒸馏(OPSD)框架,通过将特权信息整合到模型参数中来增强LLM的推理能力。这个名为统一策略内自蒸馏(USD)的新框架,通过根据学生模型的学习能力联合优化token选择和特权信息调整,解决了先前OPSD方法的局限性。另一种名为SKALD(Skill-Anchored Latent Distillation)的方法使用抽象技能卡提供密集监督,尤其是在标准奖励信息不足时,在数学基准测试上显示出显著的改进。另一项独立研究OP2SD,探讨了上下文诱导的教师行为在OPSD中的作用,表明收益不仅来自访问参考解决方案,还来自教师上下文的变化。 AI
影响 这些在自蒸馏方面的研究进展可能带来更高效、更强大的LLM,以应对复杂的推理任务。
排序理由 该集群包含三篇在arXiv上发表的学术论文,详细介绍了与大型语言模型的策略内自蒸馏相关的新方法和分析。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- GRPO
- Hugging Face
- IArxiv
- On-policy self-distillation
- OP2SD
- Qwen3-Base
- ScienceCast
- SKALD
- Unified On-Policy Self-Distillation
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →