一篇新近发表在arXiv上的研究,探讨了合成预预训练(PPT)在更大规模下对语言模型的有效性。研究发现,即使模型参数高达70亿,训练预算达到1000亿token,使用合成非自然语言数据的PPT仍能在token效率和下游性能方面提供益处。与之前的假设相反,研究表明这些收益并非主要来自学习到的语法先验,而是源于改进的远程检索能力。PPT的益处在各种训练数据混合中保持稳健,仅在完全没有网络文本时才会减弱。 AI
影响 展示了一种低成本的方法来提高语言模型在规模化下的token效率和性能,将重点从语法先验转移到远程检索。
排序理由 发表在arXiv上的研究论文,详细介绍了关于语言模型合成预预训练的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- Probabilistic Transformer
- Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →