Classifier Free Guidance
PulseAugur coverage of Classifier Free Guidance — every cluster mentioning Classifier Free Guidance across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新方法为模拟内存计算硬件重新校准扩散Transformer
研究人员开发了一种新颖的方法,用于在与模拟内存计算(CIM)硬件一起使用时重新校准扩散Transformer(DiTs)。该方法解决了CIM固有的非理想性如何扭曲分类器自由指导(CFG)信号的问题,而CFG信号对于生成高质量图像至关重要。通过仅在采样过程中调整CFG尺度,该方法有效地恢复了生成质量,显著缩小了由CIM噪声在PixArt-Sigma、PixArt-alpha和DiT-XL/2等各种模型中引起的FID分数差距。
-
研究质疑潜在扩散模型中引导方法的有效性
一篇新的研究论文重新审视了潜在扩散模型中的无分类器引导(CFG)方法,在两个开源的修正流变换器上评估了八种无需训练的技术。研究发现,没有一种单一方法能在所有测量标准上持续提高图像质量,包括构图一致性和与文本提示的语义对应性。虽然APG取得了一些最高分,但提升幅度通常在评估不确定性范围内,而注意力扰动方法在不同模型上的结果好坏参半。
-
新方法学习文本到图像扩散模型的动态引导时间表
研究人员开发了一种学习文本到图像扩散模型中动态引导时间表的新颖方法。当前模型通常使用静态的全局引导尺度,这可能不是最优的并导致伪影。这种新方法训练一个判别器来估计真实分布和引导分布之间的时间依赖性密度比,从而使生成器网络能够预测最优的、状态依赖的引导尺度。在文本到图像生成基准上的实证结果表明,该方法优于启发式时间表和先前动态引导技术。
-
Diffusion language models research tackles efficiency and confidence gaps · 6 sources tracked
近期研究探索了提高扩散语言模型(DLM)效率和有效性的方法。一篇论文研究了在解码过程中何时真正需要无分类器引导(CFG),认为其益处是特定于提示的,并且通常集中在过程的早期。另一项研究介绍了 Archer,一种无需训练的 KV 缓存方法,通过自适应地重用提示隐藏状态来加速 DLM 中的回滚能力。进一步的研究解决了 DLM 中的“表示-置信度差距”问题,即内部准确性信号与外部置信度分数不一致,并提出了一个轻量级工具来改进答案排名。此外,…
-
新的潜在质心引导技术提升自动驾驶模型指令遵循能力
研究人员开发了一种名为潜在质心引导(Latent-Centroid Steering, LCS)的新方法,以改进视觉语言模型(VLMs)在自动驾驶中遵循导航指令的能力。标准的无分类器引导(CFG)对于实时使用可能过于缓慢,因此LCS提供了一种单通道方法,将条件表示引导至预先计算的特定指令质心。该技术将推理延迟降低了约50%,并增强了指令依从性,在Bench2Drive和nuScenes等基准测试中表现出改进的性能。
-
扩散模型无需辅助模型即可实现自我修正
研究人员开发了一种名为“原位自引导”(In-situ Autoguidance)的新方法,用于扩散模型,旨在提高图像生成的质量和多样性,而无需辅助模型。该方法在推理过程中使用随机前向过程动态创建一个较差的预测,从而有效地使模型能够自我修正。该方法被提出为一种零成本解决方案,为图像生成中的高效引导树立了新基准。
-
新研究探索用于生成、鲁棒性和速度的高级扩散模型
研究人员正在为各种应用开发高级扩散模型,包括图像生成、时间序列合成和自然语言处理。Simplax 等新方法旨在通过使用辅助变量增强状态来改进分类生成,而 PhysDGM 将物理定律嵌入扩散模型中,用于动态系统中的真实时间序列数据合成。其他进展侧重于通过梯度掩蔽和空间压缩等技术增强扩散模型的对抗鲁棒性,并使用新颖的预测方法加速扩散 Transformer 的推理速度。此外,正在探索用于扩散模型更快采样以及开发平衡准确性和并行性的扩散大语…
-
新的DG-CFG方法增强了扩散模型的生成和效率
研究人员开发了一种名为分布引导CFG(DG-CFG)的新方法来提高扩散模型的性能。该技术通过概率流ODE分析分类器自由引导(CFG),推导出诱导分布的分析路径积分表示。DG-CFG通过指数路径积分校正来修改采样过程,从而更好地平衡时间步贡献并考虑信号强度。当应用于Stable Diffusion 1.5时,DG-CFG展示了改进的生成质量和更好的多样性-保真度权衡,以更少的采样步数实现了目标图像质量。
-
Moving Alphabet 论文研究训练数据对文本到视频生成模型的影响
一篇题为“Moving Alphabet”的新研究论文探讨了训练数据质量对文本到视频生成模型的影响。该研究引入了一个程序化测试平台,可以控制数据分布和字幕准确性。主要发现表明,多样化和均衡的视频内容对于泛化至关重要,而字幕质量显著影响模型性能和训练效率。虽然像分类器自由引导这样的技术可以在一定程度上弥补糟糕的预训练数据,但它们无法完全弥补,这凸显了高质量数据在开发先进文本到视频模型中的重要性。
-
新的强化学习框架提升图像模型的多样性和质量
研究人员开发了一个新的强化学习框架,用于改进自回归图像生成模型。该框架解决了现有方法中常见的输出多样性崩溃以及样本质量与分布覆盖率之间权衡的问题。通过引入一种新颖的分布级奖励——留一法FID(LOO-FID),该系统鼓励样本多样性并防止模式崩溃。当与用于语义和感知保真度的实例级奖励相结合时,该方法在LlamaGen和VQGAN架构上仅经过几百次微调迭代后,在质量和多样性指标上均显示出显著改进。
-
新方法修复了扩散模型中无分类器引导的不稳定性
研究人员发现扩散模型中无分类器引导(CFG)存在一个关键问题,即高引导水平会导致过饱和和不稳定性。他们提出了一种新颖的修复机制,用修改后的版本替换标准的CFG公式,在不增加计算成本的情况下有效稳定了该过程。这种新方法在测试网格上相对于传统CFG取得了显著的改进,获得了9/9个FID点数胜利,并在稳定Stable Diffusion 1.5等模型的强引导场景方面显示出潜力。
-
新框架CIPHER解决医疗AI诊断中的偏见问题
研究人员开发了一个名为CIPHER的新框架,以解决用于医学诊断的深度学习模型的性能差异问题。CIPHER干预了种族和性别等敏感属性可能影响图像内容的四个不同因果路径,而这是以前被忽视的复杂性。通过利用具有分类器自由引导和空文本反演的扩散模型,CIPHER可以重建患者解剖结构并合成反事实,以打破依赖链。在胸部X光和皮肤镜检查基准上的测试表明,与现有方法相比,CIPHER将最差组的差异平均减少了35.8%,同时还提高了整体诊断准确性。
-
新的vLLM流水线统一音频生成与理解
研究人员开发了一种利用vLLM统一音频理解和生成任务的新型推理流水线。该系统解决了高吞吐量多模态生成所面临的挑战,特别是对于采用复杂解码策略(如AR+NAR或多令牌预测)的语音语言模型。该流水线集成了片上声学解码器,用于端到端波形合成,并通过联合调度条件和无条件请求来优化无分类器引导,从而将吞吐量维持在非CFG吞吐量的约80%。
-
新研究解决扩散模型效率和应用问题 · 追踪8个来源
近期研究探索了扩散模型的进展,重点在于提高其效率和在各个领域的适用性。FlashDiff 引入了自适应区域执行和调度,以降低图像、视频和音频生成的服务延迟并提高吞吐量。视频扩散模型中存在“序列性差距”挑战,即性能会随着因果链的延长而下降,这表明需要改进序列计算。其他工作提出了使用检索增强扩散 Transformer 进行异步时间序列预测的 ReDiTT,并探索了无需重新训练即可提高扩散模型多样性的方差校正时间偏移。此外,Singula…
-
Momentum Guidance 提升流模型图像生成质量
研究人员推出了一种名为 Momentum Guidance (MG) 的新技术,旨在提升流模型生成的图像质量。MG 通过在 ODE 轨迹上推断当前速度来工作,在保持每步标准计算成本(一次评估)的同时提高了样本质量。该方法在 ImageNet-256 等基准测试中,在 Fréchet inception distance (FID) 等指标上取得了显著改进,并证明了其在应用于 Stable Diffusion 3 和 FLUX.1-de…
-
OrthoTryOn框架通过解决任务冲突增强统一时尚生成
研究人员开发了OrthoTryOn,一个旨在改进统一时尚生成模型的新框架。该方法解决了当虚拟试穿和服装重建等多个不同任务组合到单个模型中时出现的负迁移和梯度冲突问题。OrthoTryOn在低秩适应模块内利用正交子空间投影来消除任务特定特征的相关性。此外,它还结合了Fisher引导的负面指导,以减轻推理时残余的语义耦合,从而取得了超越独立训练模型的最新成果。
-
ModaFlow框架通过模态感知引导增强虚拟试穿效果
研究人员开发了ModaFlow,一个用于高保真虚拟试穿的新型框架,可改善服装语义保留和身体几何适应性。该系统利用模态感知引导方案,通过图像提示适配器的服装视觉嵌入进行结构引导,并通过无分类器引导控制文本嵌入。为提高准确性,ModaFlow引入了方向一致性和感知真实性的正则化损失,以及用于处理各种遮挡场景和非配对推理的掩码操纵策略。
-
用户蒸馏流匹配模型以实现更快、无CFG的图像生成
一位用户开发了一种将流匹配模型蒸馏为“校正流”模型的方法,从而能够以更少的步骤且无需分类器自由引导(CFG)来更快地生成图像。此过程涉及在模型生成的图像-噪声对上对训练好的流匹配模型进行微调。该技术旨在缩短和拉直生成路径,可能允许更快的推理,并通过将其烘焙到模型中来消除对CFG的需求。
-
新的先验指导方法增强了生成式AI桥模型
研究人员开发了一种名为先验指导(PG)的新型训练无关方法,以提高桥模型在生成式AI中的性能。该技术利用预训练期间未见的弱先验来增强模型利用现有信息的能力。该方法通过频率调制先验指导(FMPG)进一步完善,以更好地与生成过程对齐,并为图像修复任务提出了级联框架(CFG-FMPG)。实验表明,这些PG方法在各种图像翻译任务中持续改进了预训练的桥模型。
-
新的CFG-OEC方法提高了扩散模型采样精度
研究人员推出了一种新方法CFG-OEC,通过解决结构性采样误差来改进扩散模型的条件采样。该误差源于训练期间的采样规则与目标之间的不匹配。CFG-OEC修改了分类器自由引导过程,以减少条件和无条件预测误差之间的相互作用,从而提高图像生成质量。