PulseAugur
中
实时 22:58:37
English(EN) Self-Play Search Distillation for Large Language Model Reasoning

新框架生成合成数据以提升LLM推理能力

研究人员开发了一个名为自玩搜索蒸馏(SPSD)的新框架,用于生成高质量的合成数据,以提高大型语言模型(LLMs)的推理能力。该方法利用在棋盘游戏上训练的类似MuZero的网络进行自玩,将搜索记录转换为结构化的推理问题和思维链。当应用于Qwen3-4B-Base模型时,SPSD显著提高了其在数学基准测试上的表现,得分从24.1提升到36.6,并将其在未公开的游戏中的胜率从15%提高到45%。这种方法提供了一种无需大量标注即可创建数据以增强LLM推理能力的高效途径。 AI

影响 该方法可能导致LLM在复杂推理任务上进行更有效的训练,从而可能提高它们在数学和游戏等领域的表现。

排序理由 该集群描述了一篇新的研究论文,其中详细介绍了一种用于生成合成数据以提高LLM推理能力的新颖框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架生成合成数据以提升LLM推理能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Lorenzo Molfetta, Wai-Chung Kwan, Giacomo Frisoni, Luca Ragazzi, Gianluca Moro, Pavlos Vougiouklis, Jeff Z. Pan, Pasquale Minervini ·

    Self-Play Search Distillation for Large Language Model Reasoning

    arXiv:2609.30936v1 Announce Type: new Abstract: Improving reasoning abilities in Large Language Models (LLMs) requires high-quality data that exposes difficult decisions, competing alternatives, and their consequences. Data scarcity is driven by the low quality of synthetic data …