一篇新的研究论文探讨了扩展大型语言模型(LLM)词汇以支持新语言的策略,重点关注Token嵌入的初始化。研究发现,子词组合方法,特别是不对称变体,优于传统的词汇平均和外部初始化技术。最佳配置包括使用均匀子词平均和印地语特定范数校准来初始化输入嵌入矩阵,以及使用字符长度加权子词平均来初始化输出语言模型头。与标准基线相比,这种方法显著减少了继续预训练的步骤并提高了准确性,同时还表明初始化损失和每字节比特是下游收敛性的不良预测指标。 AI
影响 优化LLM对新语言的适应性,可能降低训练成本并提高多语言能力。
排序理由 学术论文,详细介绍了LLM技术的系统研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →