一项新发表在arXiv上的研究探讨了语言模型训练的最后阶段数据,即使只占其总预训练数据的一小部分,也会对其监督微调(SFT)后的行为产生显著影响。研究人员发现,在SFT和微调后阶段完全相同的模型,会根据其最终预训练窗口中使用的特定数据源而表现出显著差异。例如,最后阶段预训练了安全文本的模型,在对齐后比那些在通用网络文本或其他专业数据集上训练的模型更能抵抗有害请求。这表明,模型的最终预训练数据印记至关重要,在评估其进行后续对齐阶段的准备情况时,应与其SFT性能一同考虑。 AI
影响 强调了最终预训练数据在LLM对齐中的关键作用,表明当前的评估方法可能不足。
排序理由 学术论文,详细介绍了关于LLM训练方法论的一项新发现。[lever_c_demoted from research: ic=1 ai=1.0]
- Preference Optimization
- reinforcement learning
- safety text
- supervised fine-tuning
- synthetic educational text
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →