PulseAugur
实时 11:04:27
English(EN) Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

研究发现:数据重复在大型语言模型微调中优于数据扩展

一项新的研究论文表明,对于推理语言模型的监督微调,数据重复比数据扩展更有效。研究发现,在较小的数据集上训练更多轮次,即使达到完全记忆的程度,也能在 Olmo3-7B 模型上针对 AIME'24/25 和 GPQA 等基准测试中获得更好的泛化能力。这种方法优于在更大的数据集上训练一轮,证明了 token 准确性可以作为 SFT 的可靠停止标准。 AI

影响 提出了一种更有效的微调推理大型语言模型的方法,有可能降低数据需求和计算成本。

排序理由 在 arXiv 上发表的研究论文,详细介绍了大型语言模型微调方面的新发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现:数据重复在大型语言模型微调中优于数据扩展

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano ·

    数据重复优于长上下文监督微调中的数据缩放

    arXiv:2602.11149v2 Announce Type: replace Abstract: Supervised fine-tuning (SFT) on chain-of-thought data is an essential post-training step for reasoning language models. Standard machine learning intuition suggests that training with more unique training samples yields better g…