Direct Preference Optimization
PulseAugur coverage of Direct Preference Optimization — every cluster mentioning Direct Preference Optimization across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的“Follow the Winners”算法增强了LLM的强化学习
研究人员推出了一种名为“Follow the Winners”(FTW)的新型无批评者强化微调算法,专为代理式大型语言模型(LLM)设计。与依赖于有状态环境中不切实际的重复回滚的现有GRPO风格方法不同,FTW使用回放缓冲区样本上的序数滤波器来适应交叉熵方法。这种方法允许回报的顺序统计量具有多项式集中性,使其适用于无法进行重复回滚的场景。在代理式LLM的后训练中,FTW在Sokoban和Search-R1基线上表现出与GRPO和PPO…
-
研究发现:LLM转向向量反映人类价值几何 · 追踪3个来源
研究人员正在探索大型语言模型(LLM)中的激活转向技术,作为一种行为控制方法,它提供了对RLHF和DPO等微调技术的替代方案。一项新研究《Steering Geometry: Validating Human Value Geometry in LLM Steering Space》探讨了这些转向向量是否反映了与人类价值观相关的连贯语义结构。研究结果表明,基于分布的转向方法与人类价值拓扑的理论预测一致,而以行为为中心的方法实现了相似的…
-
使用SFT、DPO和守卫校准研究阿拉伯语LLM安全对齐
一篇新发表在arXiv上的研究探讨了改进阿拉伯语大型语言模型安全对齐的方法。研究人员评估了五种支持阿拉伯语的模型上的监督微调(SFT)、直接偏好优化(DPO)和守卫校准技术。研究结果表明,虽然仅拒绝的SFT可能导致过于宽泛的拒绝,但特定的混合SFT配置可以实现高有害提示拒绝率,同时保持可接受的良性提示拒绝率。DPO和推理守卫在不同模型上显示出不同的效果,表明需要模型特定的优化,而不是一刀切的方法。研究还指出,现代标准阿拉伯语的改进并未…
-
新的LMPO方法通过控制响应长度来增强LLM训练
研究人员推出了一种名为长度控制的基于边际的偏好优化(LMPO)的新方法,旨在改进用于训练大型语言模型的直接偏好优化(DPO)。LMPO通过引入一个统一的参考模型和一个平均对数概率优化策略,解决了长度偏差和内存效率低下等局限性。其核心创新在于Bradley-Terry框架内的长度控制、基于边际的损失函数,该函数可调节响应长度并增加首选输出和拒绝输出之间的区分度。在Mistral和LLaMA3模型上的实验表明,LMPO能有效控制长度,减少…
-
AllenAI 教程详细介绍使用 SFT、DPO 和 RLVR 对 Tulu 3 进行后训练
AllenAI 发布了一个教程,详细介绍了如何使用其 Open Instruct 框架对紧凑型指令微调语言模型进行后训练。该过程涉及三个主要阶段:监督微调 (SFT)、直接偏好优化 (DPO) 和使用 GRPO 的可验证奖励强化学习 (RLVR)。该教程通过用轻量级的 Hugging Face 和 PyTorch 实现替换分布式组件,将 Tulu 3 堆栈适配到 16 GB 运行时。它涵盖了数据准备、LoRA 适配器配置以及使用确定性…
-
量化大语言模型面临“对齐崩溃”,安全防护措施被消除
训练后量化(PTQ)大语言模型(LLMs)可能导致一种称为“对齐崩溃”的现象,即在模型被压缩到较低比特宽度(例如4位或8位)时,像RLHF和DPO这样的安全防护措施会被悄无声息地消除。这种退化在标准的性能基准测试中无法被检测到,导致模型即使在全精度状态下通过了安全评估,仍然容易受到有害提示的影响。为解决此问题,研究人员建议在压缩过程中采用选择性混合精度技术、向量量化和对比对齐优化来保持模型的安全性。
-
新的 DeepBias 框架自适应探测 LVLM 中的社会偏见
研究人员开发了 DeepBias,一个旨在彻底探测大型视觉语言模型 (LVLM) 中社会偏见的自适应框架。与静态评估方法不同,DeepBias 采用了一个动态循环,包括一个使用直接偏好优化合成和优化测试数据的 ProposerAgent,以及一个自适应加深测试用例的 DiggerAgent。该框架已被用于创建 DeepBiasBench,一个评估多个 LVLM 共享漏洞的基准,为 LVLM 安全评估建立了一种新的进化方法。
-
新方法高效评估用于 LLM 对齐的偏好数据集
研究人员开发了一种新方法,用于高效评估用于对齐大型语言模型 (LLM) 的偏好数据集。所提出的基于 Shapley 的方法,称为顺序偏好优化 (SPO),显著降低了与传统 Shapley 值计算相关的计算成本。SPO 通过在单个数据集上顺序训练模型并在推理时重建联盟策略来实现这一点,从而将所需的对齐次数从指数级降低到线性级。该方法允许更实际地评估每个偏好数据集对 LLM 对齐的贡献。
-
微调 LLM:SFT、RLHF 和 DPO 详解
本文比较了三种主要的微调大型语言模型的方法:监督微调 (SFT)、人类反馈强化学习 (RLHF) 和直接偏好优化 (DPO)。文章解释说,虽然 SFT 通常最直接且适用于许多应用,但 RLHF 和 DPO 提供了更先进的技术,可将模型行为与人类偏好保持一致。该文旨在阐明每种方法的复杂性和用例,指导用户何时采用更复杂的方法。
-
ICML 2026 投稿量激增,关注点转向 AI 推理与安全
在首尔举行的国际机器学习大会 (ICML) 2026 收到了超过 23,000 篇论文,投稿量几乎翻倍,同时保持了 26.6% 的录用率。关键研究趋势表明,研究重点正从简单地扩展模型转向“更好思考”,更加关注 LLM 推理、AI 安全与对齐,以及通过压缩和加速技术提高模型效率。中国研究人员的引用率日益提高,并开始定义研究问题,特别是 DeepSeek 在高效模型开发和多模态 AI 方面的贡献产生了影响。
-
新的DZ-TiDPO框架解决了长上下文AI对话中的状态惯性问题
研究人员开发了DZ-TiDPO,一个旨在改善长上下文对话系统时间对齐的新框架。该方法解决了“状态惯性”问题,即模型因过度关注过去的对话历史而难以适应不断变化的用户意图。DZ-TiDPO旨在解决回合间冲突,同时不负面影响模型的通用语言能力,即所谓的“上下文对齐税”。该框架提供了用于效率和精度的双重推理策略,研究表明中等规模的模型可以有效地实现时间对齐。
-
LLM框架AIGP提升电商定价表现
研究人员开发了AIGP,一个使用大型语言模型(LLM)进行电商定价的新框架。该系统旨在通过整合领域知识和非结构化信息,以实现商品交易总额(GMV)和投资回报率(ROI)等长期业务目标,从而克服传统动态定价模型的局限性。AIGP利用一个使用离线强化学习和直接偏好优化(DPO)训练的长期价值估计器(LTVE)来指导定价决策。在陶工厂进行的在线A/B测试表明,AIGP在14天内将GMV提高了13%以上,ROI提高了近8%,里程碑达成率提高了…
-
新的几何方法优化了大型语言模型的顺序学习顺序
研究人员开发了一种优化顺序学习中训练数据顺序的新颖方法,特别是针对大型语言模型。这种被称为李括号锦标赛的方法,使用一个可计算的几何量——梯度更新场的李括号交换子——来预测不同数据域之间的最佳传递顺序。该方法在指令SFT和DPO的经验测试中表现出高成对准确率,并能有效恢复多个域和大型语言模型中的最佳调度。
-
新研究探讨AI推理蒸馏方法的权重空间几何
一篇新研究论文分析了用于将推理能力蒸馏到更小AI模型中的各种离线强化学习方法的权重更新的几何特性。该研究使用Qwen3-4B基础模型,在相同的数学相关数据上训练了六种不同的方法——SFT、RFT、DFT、RIFT、Offline GRPO和DPO。分析显示,虽然SFT、RFT和RIFT产生了相似的权重差值和准确率,但DFT显著不同。Offline GRPO引入了一个正交分量,而DPO占据了一个独特的子空间,在GSM8K和AIME26基…
-
新的BALTO框架在Token级别精准定位LLM幻觉
上海交通大学和腾讯的研究人员开发了BALTO,一个新颖的强化学习框架,旨在精准消除大型语言模型(LLMs)中的幻觉。该框架通过在Token级别分配信用,仅惩罚错误的Token,同时激励正确的、事实性的Token。这一方法在最近的一篇论文中有所详述,旨在保持模型响应的丰富性和信息量,这与传统方法不同,传统方法可能会因为微小的事实错误而过度惩罚整个答案。在金融和问答数据集上的实验表明,BALTO在稳定性、效率以及平衡事实准确性与信息内容方面表现出色。
-
术语表解释大型语言模型关键微调方法
本文提供了大型语言模型微调方法的术语表,解释了SFT、LoRA、QLoRA、DPO、RLHF和GRPO等缩略语。旨在帮助用户理解这些技术之间的区别,并根据其可用数据选择最合适的方法。
-
新方法通过令牌级偏好优化增强大语言模型对齐
两篇新研究论文介绍了改进大语言模型对齐的新颖方法,特别解决了现有直接偏好优化(DPO)技术的局限性。第一篇论文TAB-PO提出了一种令牌级自适应屏障,用于将梯度更新集中在结构化生成任务中的关键模式令牌上,在Llama和Qwen模型上于SciERC数据集上显示出显著改进。第二篇论文TokenRatio提出了令牌级Bregman偏好优化(TBPO),这是一种将DPO推广到令牌级决策的原则性方法,在各种基准测试中提高了对齐质量、训练稳定性和输出多样性。
-
LLM对齐技术可防御敏感数据提取
研究人员开发了新的方法来保护大型语言模型(LLM)免受属性推断攻击,这种攻击可以提取敏感数据集信息。与需要使用原始数据重新训练模型的先前防御方法不同,这种新方法采用了训练后对齐技术。通过调整类似DPO和GRPO的基于人类反馈的强化学习(RLHF)框架,可以修改模型的输出分布,从而在无需原始训练数据的情况下隐藏数据集属性。
-
新框架增强语言模型的自适应红队测试
研究人员开发了 AdvGRPO,一个旨在增强语言模型自适应红队测试的新型联合训练框架。该方法通过采用密集多通道奖励和解耦优势归一化来解决 GRPO 在攻击者-防御者优化中的不稳定性问题。训练过程遵循课程学习,从单轮攻击开始,然后过渡到多轮场景,最后才启动联合训练,最终产生更有效的攻击和更鲁棒的防御者。
-
教程展示了使用QLoRA和DPO微调LFM2
本教程演示了如何在Google Colab上使用QLoRA和直接偏好优化(DPO)微调LFM2模型。它涵盖了使用4位量化加载基础LFM2模型、准备监督微调(SFT)数据集以及训练轻量级LoRA适配器。该过程通过DPO进行扩展,以根据用户偏好对模型的响应进行对齐,从而得到一个准备好部署的改进型检查点。