PulseAugur
实时 05:50:17
English(EN) Bridging Compute- and Data-Optimal Pretraining

新的CD缩放定律弥合了LLM预训练中的计算和数据限制

研究人员引入了新的缩放定律,称为计算-数据(CD)缩放定律,它为预训练大型语言模型提供了一个统一的框架。这些定律弥合了计算最优缩放(数据丰富)和数据最优缩放(数据集固定)之间的差距。该框架包含一个令牌有效性函数,该函数量化了派生令牌相对于新令牌的价值,并考虑了多周期重复和释义等因素。该函数表明,令牌有效性不是恒定的,而是取决于模型大小、令牌与参数的比例以及派生数据的量,这表明在大多数实际场景中,经典的计算最优分配都不是最优的。 AI

影响 引入了一种更细致的LLM预训练资源分配方法,有可能优化未来的模型开发。

排序理由 该集群包含一篇详细介绍LLM预训练新理论缩放定律的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的CD缩放定律弥合了LLM预训练中的计算和数据限制

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Tian Qin, Kimia Hamidieh, David Alvarez-Melis ·

    连接计算最优和数据最优的预训练

    arXiv:2607.25271v1 Announce Type: cross Abstract: Classical compute-optimal scaling laws assume an unbounded supply of fresh pretraining data, yet pretraining is increasingly entering a regime in which compute grows faster than the availability of high-quality data. We propose Co…