Optimized Ranking With Pairwise Observations
PulseAugur coverage of Optimized Ranking With Pairwise Observations — every cluster mentioning Optimized Ranking With Pairwise Observations across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
小型语言模型在对齐后展现出强大的生物医学文本生成能力
一篇新的研究论文探讨了小型语言模型(SLMs)在生物医学数据到文本生成中的训练后对齐技术。该研究使用基于Qwen的SLMs,比较了监督微调(SFT)、直接偏好优化(DPO)、优势比偏好优化(ORPO)和组相对策略优化(GRPO)。结果表明,与GPT-5等专有模型相比,对齐后的SLMs,特别是GRPO,在药品说明书和openFDA药物标签数据集上表现出更优越的性能和跨数据集泛化能力,优于SFT基线模型,并显示出稳健的结果。
-
ORPO 微调修复小型语言模型
本文解决了使用 ORPO(在线偏好强化学习)方法训练小型语言模型时的一个常见问题,即微调在小规模时可能会失败。作者确定了一个特定的单行代码修复来解决这个问题。该文旨在帮助开发人员成功训练小型模型以符合人类偏好。
-
EvoPref算法通过进化优化增强语言模型对齐
研究人员开发了EvoPref,这是一种新颖的多目标进化算法,旨在改进大型语言模型(LLM)的对齐。与可能导致偏好崩溃和狭窄行为模式的传统基于梯度的方法不同,EvoPref维护了针对有用性、无害性和诚实性进行优化的适配器多样化种群。这种方法显著增强了偏好覆盖范围并降低了崩溃率,同时实现了具有竞争力的对齐质量,确立了进化优化作为多样化LLM对齐的可行范式。
-
DPO 与 SimPO:用于 LLM 训练的偏好调优方法比较
最近的一项分析强调了大型语言模型偏好调优方法论中一个关键的差异,特别比较了直接偏好优化(DPO)和简化偏好优化(SimPO)。核心问题在于这些方法如何解释和利用偏好数据,DPO 是参考相对的,而 SimPO 是参考无关的。如果不仔细评估保留数据,这种差异可能导致误导性的改进,可能将收益归因于错误的目标或训练配置。