研究人员引入了新的缩放定律,称为计算-数据(CD)缩放定律,它为预训练大型语言模型提供了一个统一的框架。这些定律弥合了计算最优缩放(数据丰富)和数据最优缩放(数据集固定)之间的差距。该框架包含一个令牌有效性函数,该函数量化了派生令牌相对于新令牌的价值,并考虑了多周期重复和释义等因素。该函数表明,令牌有效性不是恒定的,而是取决于模型大小、令牌与参数的比例以及派生数据的量,这表明在大多数实际场景中,经典的计算最优分配都不是最优的。 AI
影响 引入了一种更细致的LLM预训练资源分配方法,有可能优化未来的模型开发。
排序理由 该集群包含一篇详细介绍LLM预训练新理论缩放定律的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →