研究人员开发了一个名为自玩搜索蒸馏(SPSD)的新框架,用于生成高质量的合成数据,以提高大型语言模型(LLMs)的推理能力。该方法利用在棋盘游戏上训练的类似MuZero的网络进行自玩,将搜索记录转换为结构化的推理问题和思维链。当应用于Qwen3-4B-Base模型时,SPSD显著提高了其在数学基准测试上的表现,得分从24.1提升到36.6,并将其在未公开的游戏中的胜率从15%提高到45%。这种方法提供了一种无需大量标注即可创建数据以增强LLM推理能力的高效途径。 AI
影响 该方法可能导致LLM在复杂推理任务上进行更有效的训练,从而可能提高它们在数学和游戏等领域的表现。
排序理由 该集群描述了一篇新的研究论文,其中详细介绍了一种用于生成合成数据以提高LLM推理能力的新颖框架。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- Large Language Models
- Lorenzo Molfetta
- MuZero
- Qwen3-4B-Base
- Self-Play Search Distillation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →