Direct Preference Optimization: Your Language Model is Secretly a Reward Model
PulseAugur coverage of Direct Preference Optimization: Your Language Model is Secretly a Reward Model — every cluster mentioning Direct Preference Optimization: Your Language Model is Secretly a Reward Model across labs, papers, and developer communities, ranked by signal.
- instance of Gotit.pub 90%
- instance of Direct Preference Optimization 90%
- used by Gotit.pub 70%
- developed Gotit.pub 70%
- competes with KTO 70%
- used by Grpo 70%
- used by Direct Preference Optimization 70%
- used by Influence Flower 70%
- uses Grpo 70%
- other Direct Preference Optimization 70%
- used by CatalyzeX Code Finder for Papers 70%
- used by Llama 3.1 8B-Instruct 70%
- 2026-06-03 research_milestone A new paper details how Direct Preference Optimization (DPO) improves paraphrase generation accuracy and human preference ratings. 来源
20 天有情绪数据
-
AI应用RollTab使用Transformer模型生成钢琴音乐续集
一款名为RollTab的iPhone应用已发布,该应用使用AI模型自动生成钢琴演奏的续集。该应用由Simon Edwardson开发,利用了一个定制训练的1.25亿参数Transformer模型,该模型将MIDI文件作为离散事件序列进行处理。这种方法可以快速生成音乐续集,应用能够在两秒内生成输出。Edwardson利用Gemini 3.5 Flash收集偏好数据,并使用Direct Preference Optimization (D…
-
教程通过直接偏好优化微调语言模型
本教程详细介绍了使用直接偏好优化(DPO)和Anthropic HH-RLHF数据集微调语言模型的方法。它概述了设置Colab环境、通过审计偏见和过滤来准备数据以及构建DPO训练流程的步骤。本教程演示了微调Qwen2.5-0.5B-Instruct模型、评估其性能以及分析训练数据中潜在偏见的过程。
-
Pairwise ranking beats RL for LLM explanation selection in recommendation systems
研究人员开发了一种从大型语言模型(LLM)中选择推荐系统解释的新方法,显著降低了服务成本和延迟。通过预先生成解释池并使用驻留在CPU上的选择器,该系统无需GPU即可在100毫秒内响应。研究发现,成对学习排序方法(特别是LambdaRank)在选择最佳解释方面优于单动作强化学习方法,在基准数据集上取得了更高的F1分数。
-
新型扩散模型生成可控高风险驾驶场景
研究人员开发了一种新颖的生成安全关键驾驶场景以增强自动驾驶系统的管道,名为RiskMV-DPO。该方法通过整合目标风险水平与基于物理的风险建模,实现了风险可控的多视角场景生成。该系统合成了多样化的高风险动态轨迹,并使用几何外观对齐模块和区域感知直接偏好优化策略来确保时空连贯性和几何保真度。实验表明,3D检测mAP显著提高,Fréchet inception distance降低,为主动、风险可控的综合世界模型奠定了基础。
-
新的Polaris系统利用偏好数据训练LLM以改进表格检索
研究人员开发了Polaris,一个旨在增强自然语言到SQL(NL2SQL)任务中表格检索能力的新颖系统。Polaris训练一个大型语言模型来生成针对检索效果而非仅仅流畅性进行优化的表格描述。该系统通过使用查询-表格相关性判断来创建偏好对,并通过直接偏好优化(DPO)对LLM进行微调,从而利用现有的表格检索基准。实验表明,Polaris的性能显著优于AutoDDG等当前最先进的方法,展示了重新利用检索基准来训练LLM以生成面向检索的元数据的潜力。
-
研究发现:大型语言模型中的思维链压缩会损害可信度
一篇新发表在arXiv上的研究调查了压缩长思维链(Long-CoT)推理对语言模型的影响。研究人员发现,虽然压缩方法可以降低推理成本和代币使用量,但它们常常导致可信度下降,影响安全性、幻觉抵抗能力和多语言能力。该研究提出了一个标准化的效率得分来更好地评估这些权衡,并引入了一种与对齐相关的直接偏好优化(DPO)变体,该变体在可信度损失极小的情况下实现了显著的长度缩减。
-
新研究使用CoT和DPO解决LLM中的政治偏见
一篇新研究论文提出在大型语言模型(LLMs)推理过程中缓解对抗性政治偏见的方法。该研究引入了使用思维链(CoT)提示和直接偏好优化(DPO)的策略,以保护LLM免受有偏内容注入。使用立法视频摘要进行的实验表明,递归自我纠正方法在政治中立性量表上显著提高了模型性能,将其从基线2.14提高到4.56。
-
新研究使用 MINT 和 STAGE 解决多目标 LLM 对齐问题
两篇新研究论文提出了同时对齐大型语言模型的多个目标的创新方法。第一篇论文介绍了 MINT(MIN-selection preference distillation),它在对候选响应进行排名时优先考虑最弱的目标,从而实现更平衡的结果,并提高情感支持和谈判等任务的性能。第二篇论文 STAGE 专注于在人类反馈强化学习(RLHF)中引入目标的时机,使用稳定性引导控制器来管理训练期间哪些偏好是活跃的,在多个基准列中展示了更好的平均性能。
-
构建用于LLM微调的数据集:SFT和DPO详解
本文解释了大型语言模型中监督微调(SFT)和直接偏好优化(DPO)数据集的创建过程。它详细介绍了DPO的偏好对是如何生成的,包括损失掩码的概念,并讨论了微调所需的数据,认为所需数据量比普遍认为的要少。
-
新的SEMA框架增强了对LLM的多轮越狱攻击
研究人员开发了SEMA,一个旨在改进针对大型语言模型的多轮越狱攻击的新型框架。SEMA采用两阶段过程:预填充自适应以生成结构化对抗性提示,以及具有意图漂移感知奖励的强化学习以维持有害目标。该方法在AdvBench等基准测试中取得了最先进的攻击成功率,显著优于现有方法。
-
新研究探索主动行为的开放权重LLM重编程
研究人员探索了重编程开放权重大型语言模型行为的方法,使其从被动助手角色转向更主动、苏格拉底式的互动。通过广泛的超参数扫描和时期消融研究,他们为LoRA+等参数高效微调(PEFT)技术定义了数学边界,确定了最佳LoRA秩为16,训练窗口为2-3个时期。进一步的直接偏好优化(DPO)实验成功地将断言行为与语法分离开来,跨语言测试揭示了在相关语言中强大的个性转移能力,而在形态上差异较大的语言中则存在可识别的退化。
-
新研究通过增强的控制力和质量推进视频到音频生成
两篇新研究论文介绍了视频到音频(V2A)生成的先进方法。ControlFoley 专注于通过更有效地整合视觉和文本信息以及解耦音频的时间和音色方面来增强可控性。HarmoniDPO 通过使用双视频表示和偏好优化(类似于人类反馈强化学习)来解决同步和质量问题,使生成的音频与人类感知保持一致。
-
新框架通过前瞻性模拟增强面向目标的对话
研究人员推出了一种名为偏好树优化(PTO)的新框架,旨在增强面向目标的对话系统,特别是在数据有限的专业领域。PTO通过一种称为“带前瞻性模拟的偏好树”的方法生成偏好数据,在动机访谈(MI)的背景下模拟与虚拟患者的对话。这种方法与直接偏好优化(DPO)相结合,旨在通过迭代训练来改进代理决策。实验表明,经过PTO训练的模型在MI对话中优于基线模型,在会话满意度和工作联盟方面表现更好,而更深的前瞻性模拟产生了最稳定的结果。
-
新指南优化了昂贵的预言机在蛋白质结构预测模型中的使用
一篇新论文探讨了优化昂贵外部预言机在蛋白质结构预测模型中使用的各种方法。研究人员比较了FK-steering、Direct Preference Optimization (DPO)、Best K-of-N sampling和Optimisation Over Outputs (O3),以确定管理预言机预算的最有效策略。研究发现,O3在较低预算下效率最高,而FK-steering和DPO在预算增加时表现更好,为研究人员提供了实用的指导。
-
Hugging Face 强调 AI 在优化、专业化和新模型方面的研究
Hugging Face 正在重点介绍 AI 研究和开发的几项最新进展。其中包括一种超越典型聊天机器人应用的新型直接偏好优化方法,以及关于 AI 专业化不可避免性的讨论。此外,该平台还推出了一个名为 ScarfBench 的企业 Java 框架迁移 AI 代理基准测试,以及一个专为增强边缘计算能力而设计的视觉模型 LFM2.5-VL-3B。这些帖子还涉及提供与现有模型相似优势的新模型,并探讨了可能超越流行的 LoRa 微调技术。
-
新方法提高AI模型对关键输入编辑的敏感度
一篇新研究论文介绍了“溯因偏好学习”(APL),以改进视觉和语言模型处理语义关键输入编辑的方式。当前模型常常忽略此类编辑,默认使用其预训练知识,导致在VLMBias等基准测试上的准确率较低。APL优化了溯因策略,该策略放大了稀有提示上的改进,显著提高了准确率。该方法在VLMBias上展示了显著的提升,将准确率从3%提高到44%,并且在Inverse-IFEval上也表现良好,在相似规模下优于现有模型。
-
SafeCap 框架通过字幕介导的强化学习增强 LVLM 的安全性
研究人员开发了 SafeCap,一个旨在增强大型视觉语言模型 (LVLM) 安全性的新型强化学习框架。该方法训练一个策略模型,使其在生成最终答案之前生成与安全相关的图像字幕。字幕生成通过指导冻结的 LLM 做出安全决策的程度进行优化,鼓励模型暴露对安全响应至关重要的视觉线索。在多个安全性和效用基准上的评估表明,SafeCap 在各种模型设置下显著提高了安全性表现,同时保持或增强了视觉效用,其表现优于 SFT、DPO 和 SafeGRP…
-
SafeCap 框架使用图像字幕强化学习增强 LVLM 的安全性
研究人员开发了 SafeCap,这是一个新颖的强化学习框架,旨在增强大型视觉语言模型 (LVLM) 的安全性。SafeCap 利用一种学习到的自字幕机制,模型首先为图像生成一个与安全相关的字幕,然后该字幕会指导生成最终的、对齐的响应。这种方法在安全基准测试中显示出显著的改进,在保持视觉效用的同时,其表现优于监督微调和直接偏好优化等现有方法,甚至有所提高。
-
新的DPO-Clin框架提高了AI医学报告的准确性
研究人员开发了DPO-Clin,一个旨在提高医学报告生成模型准确性的新框架。该方法通过关注临床发现和跨模态对齐来解决AI生成报告中的事实错误。DPO-Clin使用一个实体级临床诊断模块来隔离临床差异,并使用检索增强的多模态DPO变体来强制执行视觉-文本对齐。在胸部X光和内窥镜数据集上的实验表明,DPO-Clin的性能优于现有方法,并提高了模型的可靠性。
-
Se-DPO 通过自演化代币信用增强语言模型训练
研究人员推出了一种新颖的直接偏好优化(DPO)方法 Se-DPO,该方法可动态调整单个代币对偏好信号的贡献。与传统上同等对待所有代币的 DPO 不同,Se-DPO 根据每个代币的隐式奖励幅度和置信度分配“代币信用”。这种自演化信用机制通过一个轻量级的校准网络实现,旨在提高训练过程中的对齐度。实验表明性能显著提升,在 Arena-Hard 等基准测试中,Se-DPO 的表现比标准 DPO 高出 12.2 个百分点。