PulseAugur
实时 12:33:05

LLM预训练:领域数据重复的最佳次数与验证损失相关

一篇新的研究论文探讨了在大型语言模型(LLM)预训练过程中,领域特定数据的最佳重复次数。研究发现,随着模型规模的扩大和对更大训练代币预算的需求,高质量领域数据的最佳重复次数会随着模型尺寸的增加而略有增加,这与预期相反。这个最佳重复次数与领域最终验证损失的相关性比与可用唯一数据的量更强。研究结果表明,在较小模型上调整的重复策略可以作为较大模型的实际估计。 AI

影响 通过优化数据重复来提高LLM训练效率,有可能在现有计算预算下获得更好的性能。

排序理由 研究论文,详细介绍了LLM预训练方法的研究结果。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

LLM预训练:领域数据重复的最佳次数与验证损失相关

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang ·

    LLM预训练中领域数据重复的扩展

    arXiv:2608.14071v1 Announce Type: new Abstract: As large language models scale, their training-token budgets must also increase to maintain an appropriate tokens-per-parameter ratio (\(\mathrm{TPP}\)). However, high-quality domain data is much harder to scale than general web dat…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    LLM预训练中领域数据重复的扩展

    Under proportional scaling of model size and training tokens, optimal repetition of high-quality domain data increases mildly with scale and correlates with domain validation loss rather than unique data volume.