研究人员推出了一种新颖的基于流的GRPO框架LC-GRPO,该框架结合了Langevin校正,以弥合生成模型中训练和推理之间的差距。该方法解决了在使用随机微分方程(SDE)进行训练和使用常微分方程(ODE)进行推理时出现的差异,这种差异可能导致样本模糊和性能下降。通过在ODE欧拉步之后应用Langevin校正,LC-GRPO在理论上减少了Wasserstein误差,并与标准的SDE离散化相比提高了样本精度。在SD3.5-Medium、FLUX.1-Dev和HunyuanVideo等模型上的实验表明,在文本到图像和文本到视频生成任务的奖励优化方面取得了持续改进,同时保持了生成质量。 AI
影响 这项研究提供了一种方法来增强基于流的生成模型在训练和推理之间的一致性,从而可能提高它们在文本到图像和文本到视频生成等任务中的性能。
排序理由 该集群描述了一篇详细介绍改进生成模型新方法的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- Euler--Maruyama discretization
- Flux
- Grpo
- HunyuanVideo
- Langevin correction
- LC-GRPO
- SD3.5-Medium
- Wasserstein error
- ordinary differential equation
- stochastic differential equation
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →