一项新的研究论文表明,对于推理语言模型的监督微调,数据重复比数据扩展更有效。研究发现,在较小的数据集上训练更多轮次,即使达到完全记忆的程度,也能在 Olmo3-7B 模型上针对 AIME'24/25 和 GPQA 等基准测试中获得更好的泛化能力。这种方法优于在更大的数据集上训练一轮,证明了 token 准确性可以作为 SFT 的可靠停止标准。 AI
影响 提出了一种更有效的微调推理大型语言模型的方法,有可能降低数据需求和计算成本。
排序理由 在 arXiv 上发表的研究论文,详细介绍了大型语言模型微调方面的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
- AIME 24/25
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Dawid J. Kopiczko
- Gotit.pub
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Hugging Face
- Olmo3-7B
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →