研究人员提出了 FlowCPO,一种使用离线前向 KL 目标来对齐流模型和扩散模型的新方法。该方法通过利用偏好样本和非偏好样本,并无需重新进行模型采样,从而统一了现有的在线强化学习和离线偏好优化技术。FlowCPO 提供了一种基于对比流匹配的可行替代损失函数,该函数是有界的且非负的,与一些现有方法可能无下界不同。在评估中,与 FlowDPO 等基线方法相比,FlowCPO 在域内 GenEval 和 OCR 任务上表现出更好的性能。 AI
影响 引入了一种新的生成模型对齐方法,有望提高其在特定任务上的性能。
排序理由 该集群包含一篇详细介绍流模型和扩散模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →