研究人员推出了一种新颖的直接偏好优化(DPO)方法 Se-DPO,该方法可动态调整单个代币对偏好信号的贡献。与传统上同等对待所有代币的 DPO 不同,Se-DPO 根据每个代币的隐式奖励幅度和置信度分配“代币信用”。这种自演化信用机制通过一个轻量级的校准网络实现,旨在提高训练过程中的对齐度。实验表明性能显著提升,在 Arena-Hard 等基准测试中,Se-DPO 的表现比标准 DPO 高出 12.2 个百分点。 AI
影响 引入了一种更细致的偏好优化方法,有望带来更具对齐性和更强大的语言模型。
排序理由 该集群包含一篇详细介绍语言模型训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →