PulseAugur
中
实时 00:46:33

新的RWTD方法通过基于样本的奖励对齐来增强单步生成模型

研究人员开发了一种名为奖励加权传输蒸馏(RWTD)的新型后训练方法,用于单步生成模型。该技术仅使用生成的样本和标量奖励评估即可进行对齐,解决了这些模型训练的难题。RWTD通过混合倾斜的当前和参考分布来构建一个自适应目标,平衡奖励适应与保留先验知识。实证表明,RWTD将SANA Sprint 1.6B骨干模型的GenEval分数从0.73提高到0.80,并在不同奖励上展现出强大的泛化能力。 AI

影响 这种新方法可以提高单步生成模型的训练效率和性能,可能带来更好的图像和媒体生成。

排序理由 该集群包含一篇详细介绍生成模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的RWTD方法通过基于样本的奖励对齐来增强单步生成模型

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Austin Wang, Ziheng Cheng, Lexing Ying ·

    使用奖励加权传输蒸馏对齐单步生成模型

    arXiv:2609.30840v1 Announce Type: new Abstract: One-step generators enable high-quality visual generation with a single network evaluation, but their post-training is difficult: general implicit generators provide neither tractable likelihoods nor denoising trajectories, and many…