Distribution Matching Distillation
PulseAugur coverage of Distribution Matching Distillation — every cluster mentioning Distribution Matching Distillation across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新方法通过解决模式崩溃和多样性损失来增强自回归视频生成
研究人员开发了两种新方法来改进自回归视频生成模型,解决了模式崩溃和多样性损失的问题。第一种方法Mask Forcing在自回滚过程中注入掩码的更清洁信号,以防止模型崩溃到少数模式,从而在不增加训练数据的情况下提高视觉质量。第二种方法Uncertainty DMD在生成过程的关键阶段引入不确定性,包括时间步扰动和随机缓存写入,以恢复通过少步蒸馏生成的视频中的多样性和运动动态。
-
DynaForcing框架解决了头像生成的动态崩溃问题
研究人员推出DynaForcing,一个旨在通过解决动态崩溃问题来改进音频驱动的头像生成的新训练框架。这种现象会导致学生模型产生具有高视觉质量但时间动态受抑制的静态输出,破坏唇形同步和表情。DynaForcing采用三种策略:混合强制(Hybrid Forcing)将输出锚定到真实值,动态感知奖励正则化(Dynamics-Aware Reward Regularization)来抵消蒸馏目标中的偏差,以及参考扰动(Reference …
-
SQuad框架通过子二次注意力大幅降低视频Transformer的计算成本
研究人员开发了SQuad,一个子二次注意力蒸馏框架,旨在提高视频扩散Transformer(DiTs)的效率。该新方法降低了自注意力机制的计算成本,该机制通常随token数量呈二次方增长。SQuad实现了O(n√n)的复杂度,显著降低了FLOPs和延迟,同时保持了可比的视频生成质量。
-
DistillAlign 通过分布对齐改进视频蒸馏
研究人员推出了一种新颖的自回归视频蒸馏方法 DistillAlign,解决了现有分阶段流水线的局限性。该方法强调学生模型和教师模型之间的分布对齐,提出了一种结合分布匹配蒸馏 (DMD) 和一致性蒸馏的联合蒸馏技术。该方法旨在提高生成质量、覆盖率和多样性,其表现明显优于使用更大教师模型的基线。
-
AudioX-Turbo框架实现高效多模态音频生成
研究人员推出AudioX-Turbo,一个新颖的框架,旨在从文本、视频和音频信号等各种多模态输入高效生成音频。该系统采用师生蒸馏方法,将高保真教师模型AudioX-Base蒸馏成更快的学生模型AudioX-Turbo。此过程显著减少了生成所需的采样步数,使其比现有的多步基线效率高约25倍。为了支持该框架,还创建了一个名为IF-caps-Pro的大型数据集,包含约920万个样本。
-
AMD新技术提升生成模型稳定性和保真度
研究人员开发了一种名为自适应匹配蒸馏(Adaptive Matching Distillation, AMD)的新框架,以提高少样本生成模型的稳定性和性能。AMD通过使用奖励代理来检测和逃离现有蒸馏方法难以处理的“禁区”问题。在SDXL和Wan2.1等图像和视频生成任务上的实验表明,AMD提高了样本保真度和训练鲁棒性,尤其是在SDXL上显著提升了HPSv2分数。
-
扩散模型蒸馏在高维空间中表现出“复制”行为
研究人员在扩散模型的高维蒸馏中发现了一种称为“复制”的现象。当蒸馏出的学生模型复制教师模型的原始噪声-数据配对时,就会发生这种情况,而在低维设置中并未观察到这种行为。研究表明,这种复制是由于学生模型在蒸馏过程中几何自由度有限而产生的涌现特性,而不是对抗性目标或教师记忆所致。
-
新的CDM方法增强了扩散模型蒸馏,实现了更快、更高保真度的图像生成
研究人员推出了一种新颖的连续时间分布匹配(CDM)方法,用于加速扩散模型。该方法超越了离散时间蒸馏,采用了动态、连续的时间表和轨迹外匹配目标。CDM旨在提高少步扩散过程中的图像生成保真度和细节保留,而无需复杂的辅助模块(如GAN)。