Optimized Ranking With Pairwise Observations
PulseAugur coverage of Optimized Ranking With Pairwise Observations — every cluster mentioning Optimized Ranking With Pairwise Observations across labs, papers, and developer communities, ranked by signal.
-
新研究探讨大型语言模型拒绝机制和控制向量
两篇新研究论文深入探讨了让大型语言模型拒绝有害请求的机制。第一篇论文比较了监督微调、推理增强微调和 ORPO 等不同的训练后方法在各种模型上的表现,发现训练方法显著改变了内部拒绝计算。第二篇论文研究了表示控制,揭示了控制向量主要与注意力机制的 OV 电路交互,并且在很大程度上忽略了 QK 电路,有可能在不损失性能的情况下进行显著稀疏化。
-
神经符号对齐将临床LLM安全性提升21%
研究人员开发了一种名为神经符号对齐的新型训练框架,以增强临床语言模型的安全性。该方法将一个7B参数的临床LLM与一个基于大型生物医学知识图谱构建的生理世界模型相结合。通过根据稳态约束和药物相互作用惩罚对候选响应进行评分,该框架显著提高了模型生成生理安全建议的能力,在安全性指标上优于现有方法甚至GPT-4。
-
小型语言模型在对齐后展现出强大的生物医学文本生成能力
一篇新的研究论文探讨了小型语言模型(SLMs)在生物医学数据到文本生成中的训练后对齐技术。该研究使用基于Qwen的SLMs,比较了监督微调(SFT)、直接偏好优化(DPO)、优势比偏好优化(ORPO)和组相对策略优化(GRPO)。结果表明,与GPT-5等专有模型相比,对齐后的SLMs,特别是GRPO,在药品说明书和openFDA药物标签数据集上表现出更优越的性能和跨数据集泛化能力,优于SFT基线模型,并显示出稳健的结果。
-
ORPO 微调修复小型语言模型
本文解决了使用 ORPO(在线偏好强化学习)方法训练小型语言模型时的一个常见问题,即微调在小规模时可能会失败。作者确定了一个特定的单行代码修复来解决这个问题。该文旨在帮助开发人员成功训练小型模型以符合人类偏好。
-
EvoPref算法通过进化优化增强语言模型对齐
研究人员开发了EvoPref,这是一种新颖的多目标进化算法,旨在改进大型语言模型(LLM)的对齐。与可能导致偏好崩溃和狭窄行为模式的传统基于梯度的方法不同,EvoPref维护了针对有用性、无害性和诚实性进行优化的适配器多样化种群。这种方法显著增强了偏好覆盖范围并降低了崩溃率,同时实现了具有竞争力的对齐质量,确立了进化优化作为多样化LLM对齐的可行范式。
-
DPO 与 SimPO:用于 LLM 训练的偏好调优方法比较
最近的一项分析强调了大型语言模型偏好调优方法论中一个关键的差异,特别比较了直接偏好优化(DPO)和简化偏好优化(SimPO)。核心问题在于这些方法如何解释和利用偏好数据,DPO 是参考相对的,而 SimPO 是参考无关的。如果不仔细评估保留数据,这种差异可能导致误导性的改进,可能将收益归因于错误的目标或训练配置。