研究人员推出了一种新颖的训练潜在扩散模型的方法ToPO(Token-Oriented Preference Optimization),该方法使用成对图像偏好进行训练。与先前将偏好应用于完整图像的方法不同,ToPO构建了一个时空路径,在去噪过程中纳入这些偏好。该方法利用内容令牌来调节交叉注意力,并包含一个辅助像素中点排序项,无需局部标签或学习到的奖励模型。评估表明,在SD-1.5和SDXL模型的多个指标上,ToPO的性能优于Diffusion-DPO,在比较研究中显示出更高的终点估计和更大的胜率。 AI
影响 这种新方法可以通过更好地利用成对偏好来提高生成图像模型的训练效率和有效性。
排序理由 该集群包含一篇详细介绍扩散模型训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Diffusion-DPO
- HPSv2
- ImageReward
- SD Negeri 1.5 Belimbing
- SDXL
- Token-Oriented Preference Optimization
- ToPO
- U-Net
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →