一篇新的研究论文探讨了在大型语言模型(LLM)预训练过程中,领域特定数据的最佳重复次数。研究发现,随着模型规模的扩大和对更大训练代币预算的需求,高质量领域数据的最佳重复次数会随着模型尺寸的增加而略有增加,这与预期相反。这个最佳重复次数与领域最终验证损失的相关性比与可用唯一数据的量更强。研究结果表明,在较小模型上调整的重复策略可以作为较大模型的实际估计。 AI
影响 通过优化数据重复来提高LLM训练效率,有可能在现有计算预算下获得更好的性能。
排序理由 研究论文,详细介绍了LLM预训练方法的研究结果。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- Scite
- domain data
- large language models
- LLM Pretraining
- model size
- tokens-per-parameter ratio
- training-token budgets
- validation loss
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →