研究人员开发了一种新的以学生为中心的蒸馏框架 SCoRe,旨在提高小型大型语言模型 (LLM) 在代理任务中的性能。与让小型模型模仿大型模型的传统方法不同,SCoRe 允许学生模型生成自己的训练轨迹,而教师模型仅纠正初始错误。这种方法根据学生的能力定制训练数据,有效地突出了特定的弱点。然后,学生模型将在这些纠正后的轨迹上进行微调,并使用短视强化学习进行进一步训练,这提高了稳定性并允许无约束的探索。该方法已成功缩小了在 12 个具有挑战性的基准测试中,一个 7B 参数的学生模型和一个 72B 参数的教师模型之间的代理性能差距。 AI
影响 这项新的蒸馏技术可以实现更高效的、有能力的 AI 代理的训练,从而可能降低部署成本并提高可访问性。
排序理由 学术论文,详细介绍了一种蒸馏 LLM 能力的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Model
- ScienceCast
- Yuanjie Lyu
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →