RTDMD
PulseAugur coverage of RTDMD — every cluster mentioning RTDMD across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的RL原生蒸馏框架提升图像生成效率
研究人员开发了一个名为REST(Reward-Enhanced Scored-Trajectory Distillation)的新框架,该框架将强化学习(RL)与少步蒸馏相结合,以实现更高效的文本到图像生成。该方法允许学生模型从RL教师轨迹的中间状态进行学习,避免了顺序训练成本。此外,引入了优势调制蒸馏(AMD)来将监督集中在首选轨迹上,从而提高学生模型的性能。实验表明,REST在训练量显著减少的情况下,可以达到或超过其40步RL教师的质量。
-
新的RL原生蒸馏框架提升文本到图像生成效率
研究人员开发了一个名为奖励增强评分轨迹蒸馏(REST)的新框架,该框架将强化学习(RL)与少步蒸馏相结合,以实现更高效的文本到图像生成。与之前顺序训练这些组件的方法不同,REST在一个阶段内共同训练它们。这种方法利用RL教师生成的奖励评分轨迹来监督学生模型,防止在压缩过程中损失奖励增益。一种额外的技术,优势调制蒸馏(AMD),通过利用不同轨迹的优势来调节蒸馏监督,从而进一步完善这一过程,加强从首选输��学习并抑制不太理想的输出。实验表…
-
新框架增强文本到图像模型与人类偏好的对齐
研究人员开发了两个新颖的框架,DIDR和RTDMD,以改进文本到图像生成模型与人类偏好的对齐。DIDR(Diff-Instruct with Diffused Reward)是一个无数据框架,可在扩散轨迹的所有噪声水平上优化奖励,从而提高图像保真度。RTDMD是一种两阶段方法,将分布匹配蒸馏与奖励引导的强化学习相结合,用于少步生成器。这两种方法在偏好、美学和构图指标方面都显示出显著的改进,其中RTDMD仅用几步推理即可在SD3、SD3…