PulseAugur
实时 11:04:32
English(EN) Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

Se-DPO 通过自演化代币信用增强语言模型训练

研究人员推出了一种新颖的直接偏好优化(DPO)方法 Se-DPO,该方法可动态调整单个代币对偏好信号的贡献。与传统上同等对待所有代币的 DPO 不同,Se-DPO 根据每个代币的隐式奖励幅度和置信度分配“代币信用”。这种自演化信用机制通过一个轻量级的校准网络实现,旨在提高训练过程中的对齐度。实验表明性能显著提升,在 Arena-Hard 等基准测试中,Se-DPO 的表现比标准 DPO 高出 12.2 个百分点。 AI

影响 引入了一种更细致的偏好优化方法,有望带来更具对齐性和更强大的语言模型。

排序理由 该集群包含一篇详细介绍语言模型训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Se-DPO 通过自演化代币信用增强语言模型训练

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Wenxiao Zhao, Shu Wang, Ying Nian Wu ·

    Se-DPO:用于直接偏好优化的自演化代币信用

    arXiv:2608.09568v1 Announce Type: new Abstract: Direct Preference Optimization (DPO) aggregates token-level log-probability ratios via uniform summation, implicitly treating all tokens as contributing equally to the preference signal. However, the contribution of individual token…