研究人员发现,基础模型响应中的特定起始标记可以显著提高其推理能力,使其性能接近通过强化学习(RL)训练的模型。通过操纵这些标记提示,例如使用“\n\nOkay”或“Alright,”,在MATH-500等数学基准测试上的性能可以大幅提升。研究进一步揭示,这些提示是从训练数据中学习到的,而RL训练使它们出现的概率更高。对训练数据进行因果干预甚至可以将任意词语变成有效的推理提示,这表明数据内容与模型行为(包括安全相关响应)之间存在直接联系。 AI
影响 表明通过特定数据提示对基础模型进行微调,可以在没有大量RL训练的情况下显著提升推理能力。
排序理由 学术论文,详细介绍了关于模型行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →