研究人员开发了 VISTA,一种用于策略内自蒸馏 (OPSD) 的新方法,可增强 AI 模型的推理能力。与标准的 OPSD 不同,VISTA 基于结果验证的 rollout 来适应教师模型,重点关注教师和学生分布显著不同的区域。该方法在 Qwen3 不同大小的模型(1.7B、4B 和 8B)上,跨多个数学竞赛进行了测试,与传统的 OPSD 相比,Avg@12 分数有所提高。 AI
影响 增强 AI 模型的推理能力,可能提高其在复杂任务上的性能。
排序理由 这是一篇详细介绍 AI 模型训练新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →