研究人员开发了一种名为验证器门控多专家策略内蒸馏(VG-OPD)的新方法,以提高AI模型的科学推理能力。该技术解决了现有方法在序列级别分配监督的局限性,这些方法假设教师的有用性是均匀的。VG-OPD通过验证专家在特定答案标准上的反事实收益,将监督定位在发生分歧的地方,并按标准重要性加权,从而确定哪个专家应该教授哪个令牌。当应用于具有4B和8B学生模型的科学推理任务时,VG-OPD在七个基准测试中取得了卓越的性能,尤其在知识密集型科学推理方面表现出色。 AI
影响 该方法有望为复杂的科学推理任务带来更强大的AI模型。
排序理由 该集群包含一篇详细介绍新AI方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- 4B students
- 8B students
- arXiv
- Hugging Face
- On-Policy Distillation
- reinforcement learning
- Verifier-Gated Multi-Expert On-Policy Distillation
- VG-OPD
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →