研究人员开发了一种名为奖励加权传输蒸馏(RWTD)的新型后训练方法,用于单步生成模型。该技术仅使用生成的样本和标量奖励评估即可进行对齐,解决了这些模型训练的难题。RWTD通过混合倾斜的当前和参考分布来构建一个自适应目标,平衡奖励适应与保留先验知识。实证表明,RWTD将SANA Sprint 1.6B骨干模型的GenEval分数从0.73提高到0.80,并在不同奖励上展现出强大的泛化能力。 AI
影响 这种新方法可以提高单步生成模型的训练效率和性能,可能带来更好的图像和媒体生成。
排序理由 该集群包含一篇详细介绍生成模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →