PulseAugur
实时 07:01:54
English(EN) How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

新研究详细介绍了生成高质量LLM预训练数据的最佳方法

研究人员对为大型语言模型合成高质量预训练数据进行了系统研究,生成了超过一万亿个token。他们的发现表明,结构化输出格式(如表格、数学问题、FAQ和教程)比精选的网络文本或先前的方法更有效。研究还发现,超过1B参数的生成模型尺寸没有带来额外的好处,原始数据的选择对性能有显著影响。这项研究促成了FinePhrase的开发,这是一个包含4860亿个token的数据集,其性能优于现有的合成数据基线,同时将生成成本降低了高达30倍。 AI

影响 这项研究提供了一种可扩展且经济高效的高质量合成数据生成方法,有望加速LLM的开发。

排序理由 该集群包含一篇研究论文,详细介绍了用于LLM预训练的数据合成的系统研究。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究详细介绍了生成高质量LLM预训练数据的最佳方法

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Joel Niklaus, Atsuki Yamaguchi, Michal \v{S}tef\'anik, Guilherme Penedo, Hynek Kydl\'i\v{c}ek, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf ·

    如何合成高质量预训练数据?一项关于提示设计、生成模型和源数据的系统性研究

    arXiv:2604.13977v2 Announce Type: replace Abstract: Synthetic data is a standard component in training large language models, yet systematic comparisons across design dimensions, including rephrasing strategy, generator model, and source data, remain absent. We conduct extensive …