研究人员推出了一种名为输出嵌入中心化(OEC)的新策略,以稳定大语言模型(LLMs)的预训练。该方法通过分析输出嵌入的几何形状并确定各向异性嵌入是根本原因,从而解决了输出logit发散这一常见的训练不稳定性问题。OEC可以实现为一种称为μ-centering的确定性操作,或一种称为μ-loss的正则化技术,在实验测试中,这两种方法都表现出优于z-loss等现有方法的性能。 AI
影响 提供了一种更稳定且可能对超参数不那么敏感的大语言模型预训练方法,这有望降低训练成本并提高模型质量。
排序理由 详细介绍大语言模型预训练新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Felix Stollenwerk
- Hugging Face
- logit soft-capping
- Output Embedding Centering
- \u00b5-centering
- \u00b5-loss
- z-loss
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →