研究人员开发了一种方法,用于将基于英语的质量分类器适配于多语言大型语言模型(LLM)的高质量预训练数据选择。该方法通过在Transformer编码器嵌入之上训练一个小型多层感知机来实现,使用机器翻译文本和英语分类器的分数作为标签。跨不同模型规模的实验表明,这种多语言适配在不损害区域和文化知识的情况下,保持了下游LLM基准性能。 AI
影响 通过利用现有的英语数据质量分类器,实现了更有效和高效的多语言LLM预训练。
排序理由 学术论文,详细介绍了LLM预训练数据选择的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →