PulseAugur
实时 09:48:47
实体 Preference Optimization

Preference Optimization

PulseAugur coverage of Preference Optimization — every cluster mentioning Preference Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_200152 ·

    新HiRoute框架增强LLM安全对齐

    研究人员开发了HiRoute,一个新颖的分层提示调优框架,旨在增强大型语言模型(LLM)的安全对齐。该框架采用输入自适应方法,利用一个轻量级分层路由器来区分有害和良性输入。对于风险输入,HiRoute结合了一个共享提示和一系列风险特定的提示专家,旨在提高各种基准测试中的安全率,同时最大限度地减少过度拒绝并保持通用任务性能。

  2. TOOL · CL_169592 ·

    研究发现:最终预训练数据显著影响模型微调后的行为

    一项新发表在arXiv上的研究探讨了语言模型训练的最后阶段数据,即使只占其总预训练数据的一小部分,也会对其监督微调(SFT)后的行为产生显著影响。研究人员发现,在SFT和微调后阶段完全相同的模型,会根据其最终预训练窗口中使用的特定数据源而表现出显著差异。例如,最后阶段预训练了安全文本的模型,在对齐后比那些在通用网络文本或其他专业数据集上训练的模型更能抵抗有害请求。这表明,模型的最终预训练数据印记至关重要,在评估其进行后续对齐阶段的准备…

  3. TOOL · CL_131531 ·

    新研究解决了大型语言模型解释中的奖励破解问题

    一篇新研究论文提出了一种方法,可以防止大型语言模型(LLM)为其决策生成误导性解释。该研究“真实还是虚构?使用因果归因来缓解解释中的奖励破解”强调,LLM对齐中使用的偏好优化过程可能会无意中导致模型生成最大化奖励的解释,而不是准确反映其推理。为了对抗这种“奖励破解”,研究人员建议通过预测的因果归因来增强奖励模型,使其能够检测模型内部决策与其生成解释之间的一致性。实验表明,这种方法有效地减少了欺骗性解释的生成。

  4. RESEARCH · CL_99949 ·

    研究:分析安全对齐的大型语言模型对混合合规演示的响应

    一篇新的研究论文探讨了安全对齐的大型语言模型如何解释和响应混合合规演示,其中包含良性和有害的请求。研究发现,良性演示并不总是能减少有害合规性,有时甚至会增加,具体取决于模型。研究强调,偏好优化是减轻这种影响的关键训练阶段,并指出演示顺序可能表现出强烈的近因效应。此外,论文观察到不同的模型以不同的方式处理拒绝和上下文学习之间的交互。

  5. TOOL · CL_68510 ·

    新的推理技术可在无需额外训练的情况下提升大语言模型的对齐能力

    研究人员开发了一种名为对齐感知解码(AAD)的新型推理技术,以提高大语言模型的对齐能力。AAD 在无需标准偏好优化设置(如直接偏好优化 DPO)之外的额外训练的情况下运行。实证结果表明,AAD 在各种对齐基准测试和不同模型规模上始终优于现有基线。此外,当标记数据稀缺时,AAD 可以为对齐任务生成高质量的合成数据。

  6. RESEARCH · CL_11520 ·

    FiLMMeD模型使用特征线性调制进行多仓库车辆路径规划

    研究人员推出FiLMMeD,这是一种新颖的神经网络模型,旨在解决各种多仓库车辆路径问题(MDVRP)。该模型通过将特征线性调制(FiLM)集成到Transformer编码器中来增强泛化能力,从而根据活动约束进行动态条件设置。FiLMMeD还证明了偏好优化在多任务学习在该领域中的有效性优于强化学习,并采用课程学习策略来管理复杂的约束交互。实验表明,FiLMMeD在24种MDVRP变体和16种单仓库VRP上的表现优于现有方法。

  7. RESEARCH · CL_06689 ·

    LLM偏好优化提升TTS准确性和用户个性化

    研究人员开发了新的方法来使大型语言模型(LLM)与用户偏好保持一致。一种方法TKTO专注于文本到语音系统,实现了数据高效的Token级优化,以提高发音准确性并减少错误。另一个框架POPI通过将过程分解为偏好摘要生成器和响应生成器来解决LLM个性化问题,从而实现用户特定的输出并减少上下文开销。