研究人员推出了一种新颖的基于流的生成模型框架LC-GRPO,该框架解决了训练和推理采样之间的差异。通过在ODE欧拉步后加入Langevin校正步,LC-GRPO旨在减少Wasserstein误差并提高随机训练滚动的准确性。该方法在包括SD3.5-Medium、FLUX.1-Dev和HunyuanVideo等模型在内的各种文本到图像和文本到视频任务中,在奖励优化和生成质量方面均取得了持续改进。 AI
影响 提高了生成模型中训练-推理的一致性,有望增强多模态任务中的样本质量和奖励优化。
排序理由 该集群包含一篇详细介绍基于流的生成模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Euler--Maruyama discretization
- Flux
- Grpo
- HunyuanVideo
- Langevin correction
- LC-GRPO
- SD3.5-Medium
- Wasserstein error
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →