研究人员对为大型语言模型合成高质量预训练数据进行了系统研究,生成了超过一万亿个token。他们的发现表明,结构化输出格式(如表格、数学问题、FAQ和教程)比精选的网络文本或先前的方法更有效。研究还发现,超过1B参数的生成模型尺寸没有带来额外的好处,原始数据的选择对性能有显著影响。这项研究促成了FinePhrase的开发,这是一个包含4860亿个token的数据集,其性能优于现有的合成数据基线,同时将生成成本降低了高达30倍。 AI
影响 这项研究提供了一种可扩展且经济高效的高质量合成数据生成方法,有望加速LLM的开发。
排序理由 该集群包含一篇研究论文,详细介绍了用于LLM预训练的数据合成的系统研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →