研究人员开发了一种名为Influence-Directed Adaptive On-Policy Distillation (IDA-OPD)的新方法,以解决采样令牌策略内蒸馏中的多样性瓶颈。该技术使用一种新颖的一阶局部熵影响度量来理解熵变化如何影响蒸馏过程。通过保留熵扩展更新并自适应地缩小熵收缩更新,IDA-OPD在不需要完整词汇表教师概率的情况下有效地将教师模型的多样性转移给学生模型,从而以更低的计算成本提高了pass@k分数。 AI
影响 提高了AI模型蒸馏中的多样性转移,可能导致学生模型在计算开销更小的情况下能力更强。
排序理由 详细介绍AI模型蒸馏新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- First-Order Local Entropy Influence
- FLNA
- Forward KL
- IDA-OPD
- Influence-Directed Adaptive On-Policy Distillation
- Influence-Directed Distillation
- Sampled-token on-policy distillation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →