PulseAugur
中
实时 06:18:04
实体 Classifier Free Guidance

Classifier Free Guidance

PulseAugur coverage of Classifier Free Guidance — every cluster mentioning Classifier Free Guidance across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
29
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
28
90 天内 28
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_284632 ·

    新的全局传输方法增强了引导式AI图像生成

    研究人员推出了一种名为全局传输(GT)的新方法,用于改进流模型中的条件生成。与之前需要为每个条件单独耦合的方法不同,GT不依赖类别且在没有类别标签的情况下计算。虽然GT本身可能会降低性能,但它与分类器自由引导(CFG)的结合可以在各种领域、模型规模和采样预算中持续提高生成质量。这表明在引导推理过程中评估条件流中耦合的有效性,而不是在无引导生成中评估。

  2. TOOL · CL_284548 ·

    新的PPG2Speech模型可编辑母语语音以实现二语发音

    研究人员开发了一个名为PPG2Speech的基于扩散的模型,用于将母语语音编辑成第二语言,特别针对芬兰语等资源匮乏的语言。该模型将语音后验图(PPG)转换为语音,无需文本对齐即可进行单个音素编辑。PPG2Speech通过分类器自由引导和Sway采样等技术增强了Matcha-TTS解码器,并引入了新的评估指标“语音对齐一致性”(PAC)来评估编辑效果。该方法在约60小时的芬兰语语音数据上进行了验证,并将结果与传统的基于TTS的编辑方法进行了比较。

  3. TOOL · CL_280178 ·

    新的谱引导方法提升AI图像生成质量

    研究人员开发了一种名为谱校正引导的新方法,以提高扩散模型中图像生成的质量。该技术分析采样过程中中间状态的光谱对齐情况,以确保与预期的前向过程一致。通过校正与解析参考光谱的偏差,该方法在无需重新训练模型的情况下提高了对齐度和视觉保真度。在文本到图像生成和ImageNet数据集上的实验表明,即使使用更少的去噪步骤,其性能也显著优于现有的引导方法。

  4. RESEARCH · CL_271369 ·

    扩散模型研究解决覆盖率、表格数据和效率问题 · 跟踪 6 个来源

    近期研究探索了扩散模型的进展,重点是提高其效率和覆盖率。一篇论文介绍了 'pass@k' 来评估蒸馏扩散模型的分布覆盖率,揭示某些训练目标可能会牺牲广泛覆盖率以换取单次抽样的质量。另一项研究提出了 CDMD,一种用于表格数据的跨数据集扩散模型,该模型在异构数据集上以更少的参数实现了高质量生成。此外,还详细介绍了改进的分布扩散模型 (DDM),它们减轻了训练开销,并允许进行依赖于时间的超参数调整,从而在图像生成任务上表现出色,且在不同采…

  5. TOOL · CL_254181 ·

    扩散模型为机器人生成个性化步态轨迹

    研究人员开发了条件扩散模型,用于生成用于可穿戴机器人和康复的肌肉骨骼步态轨迹。这些模型可以适应个体患者参数和治疗目标,同时保持生物力学真实性。使用包含 4,590 个步态周期的数据集进行的实验表明,扩散模型可以生成逼真的步态轨迹,并对步态特征具有一定的可控性,这表明它们在个性化步态合成方面具有潜力。

  6. TOOL · CL_231733 ·

    DICE技术通过优化嵌入来增强文本到图像生成

    研究人员开发了一种名为DICE(Distilling Classifier-Free Guidance into Text Embeddings)的新技术,以改进文本到图像生成。DICE优化文本嵌入,使其能够模仿无分类器引导(CFG)的效果,而无需相关的计算成本。该方法旨在提高生成图像与文本提示的对齐度,同时显著加快采样过程。在Stable Diffusion v1.5、SDXL和PixArt等模型上的实验证明了DICE在保留语义信息…

  7. TOOL · CL_229247 ·

    PathGuide框架动态优化生成模型引导

    研究人员推出PathGuide,一个新框架,可动态优化生成模型中无分类器引导(CFG)的引导尺度。该方法将CFG选择重新构建为在线策略传输问题,利用连续性方程推导出路径正确性解释。PathGuide在生成过程中在线计算最优引导尺度,或离线拟合它们作为可重用计划,在图像流形和连续时间流模型上展示了比现有自适应引导基线更高的样本保真度。

  8. RESEARCH · CL_241532 ·

    新研究为生成模型的流匹配提供了几何和基于残差的视角

    两篇新研究论文探讨了生成模型流匹配技术的进展。第一篇论文《从分阶段几何角度看流匹配和无分类器引导的粒子动力学》为连续和离散采样提供了统一的几何理论,详细说明了轨迹如何被吸引以及引导如何重塑数据几何。第二篇论文《概率偏微分方程的残差增强流匹配算子》引入了一个通过关注表征低保真度和高保真度解之间差异的概率残差算子来学习具有潜在不确定性的代理模型的框架。Hugging Face 的相关分析从拉格朗日视角对流匹配进行了分析,从以粒子为中心的观…

  9. TOOL · CL_212179 ·

    新方法为模拟内存计算硬件重新校准扩散Transformer

    研究人员开发了一种新颖的方法,用于在与模拟内存计算(CIM)硬件一起使用时重新校准扩散Transformer(DiTs)。该方法解决了CIM固有的非理想性如何扭曲分类器自由指导(CFG)信号的问题,而CFG信号对于生成高质量图像至关重要。通过仅在采样过程中调整CFG尺度,该方法有效地恢复了生成质量,显著缩小了由CIM噪声在PixArt-Sigma、PixArt-alpha和DiT-XL/2等各种模型中引起的FID分数差距。

  10. TOOL · CL_206661 ·

    研究质疑潜在扩散模型中引导方法的有效性

    一篇新的研究论文重新审视了潜在扩散模型中的无分类器引导(CFG)方法,在两个开源的修正流变换器上评估了八种无需训练的技术。研究发现,没有一种单一方法能在所有测量标准上持续提高图像质量,包括构图一致性和与文本提示的语义对应性。虽然APG取得了一些最高分,但提升幅度通常在评估不确定性范围内,而注意力扰动方法在不同模型上的结果好坏参半。

  11. TOOL · CL_204047 ·

    新方法学习文本到图像扩散模型的动态引导时间表

    研究人员开发了一种学习文本到图像扩散模型中动态引导时间表的新颖方法。当前模型通常使用静态的全局引导尺度,这可能不是最优的并导致伪影。这种新方法训练一个判别器来估计真实分布和引导分布之间的时间依赖性密度比,从而使生成器网络能够预测最优的、状态依赖的引导尺度。在文本到图像生成基准上的实证结果表明,该方法优于启发式时间表和先前动态引导技术。

  12. RESEARCH · CL_191278 ·

    Diffusion language models research tackles efficiency and confidence gaps · 6 sources tracked

    近期研究探索了提高扩散语言模型(DLM)效率和有效性的方法。一篇论文研究了在解码过程中何时真正需要无分类器引导(CFG),认为其益处是特定于提示的,并且通常集中在过程的早期。另一项研究介绍了 Archer,一种无需训练的 KV 缓存方法,通过自适应地重用提示隐藏状态来加速 DLM 中的回滚能力。进一步的研究解决了 DLM 中的“表示-置信度差距”问题,即内部准确性信号与外部置信度分数不一致,并提出了一个轻量级工具来改进答案排名。此外,…

  13. TOOL · CL_180908 ·

    新的潜在质心引导技术提升自动驾驶模型指令遵循能力

    研究人员开发了一种名为潜在质心引导(Latent-Centroid Steering, LCS)的新方法,以改进视觉语言模型(VLMs)在自动驾驶中遵循导航指令的能力。标准的无分类器引导(CFG)对于实时使用可能过于缓慢,因此LCS提供了一种单通道方法,将条件表示引导至预先计算的特定指令质心。该技术将推理延迟降低了约50%,并增强了指令依从性,在Bench2Drive和nuScenes等基准测试中表现出改进的性能。

  14. TOOL · CL_178490 ·

    扩散模型无需辅助模型即可实现自我修正

    研究人员开发了一种名为“原位自引导”(In-situ Autoguidance)的新方法,用于扩散模型,旨在提高图像生成的质量和多样性,而无需辅助模型。该方法在推理过程中使用随机前向过程动态创建一个较差的预测,从而有效地使模型能够自我修正。该方法被提出为一种零成本解决方案,为图像生成中的高效引导树立了新基准。

  15. RESEARCH · CL_178234 ·

    新研究探索用于生成、鲁棒性和速度的高级扩散模型

    研究人员正在为各种应用开发高级扩散模型,包括图像生成、时间序列合成和自然语言处理。Simplax 等新方法旨在通过使用辅助变量增强状态来改进分类生成,而 PhysDGM 将物理定律嵌入扩散模型中,用于动态系统中的真实时间序列数据合成。其他进展侧重于通过梯度掩蔽和空间压缩等技术增强扩散模型的对抗鲁棒性,并使用新颖的预测方法加速扩散 Transformer 的推理速度。此外,正在探索用于扩散模型更快采样以及开发平衡准确性和并行性的扩散大语…

  16. RESEARCH · CL_158694 ·

    新的DG-CFG方法增强了扩散模型的生成和效率

    研究人员开发了一种名为分布引导CFG(DG-CFG)的新方法来提高扩散模型的性能。该技术通过概率流ODE分析分类器自由引导(CFG),推导出诱导分布的分析路径积分表示。DG-CFG通过指数路径积分校正来修改采样过程,从而更好地平衡时间步贡献并考虑信号强度。当应用于Stable Diffusion 1.5时,DG-CFG展示了改进的生成质量和更好的多样性-保真度权衡,以更少的采样步数实现了目标图像质量。

  17. RESEARCH · CL_156592 ·

    Moving Alphabet 论文研究训练数据对文本到视频生成模型的影响

    一篇题为“Moving Alphabet”的新研究论文探讨了训练数据质量对文本到视频生成模型的影响。该研究引入了一个程序化测试平台,可以控制数据分布和字幕准确性。主要发现表明,多样化和均衡的视频内容对于泛化至关重要,而字幕质量显著影响模型性能和训练效率。虽然像分类器自由引导这样的技术可以在一定程度上弥补糟糕的预训练数据,但它们无法完全弥补,这凸显了高质量数据在开发先进文本到视频模型中的重要性。

  18. TOOL · CL_139635 ·

    新的强化学习框架提升图像模型的多样性和质量

    研究人员开发了一个新的强化学习框架,用于改进自回归图像生成模型。该框架解决了现有方法中常见的输出多样性崩溃以及样本质量与分布覆盖率之间权衡的问题。通过引入一种新颖的分布级奖励——留一法FID(LOO-FID),该系统鼓励样本多样性并防止模式崩溃。当与用于语义和感知保真度的实例级奖励相结合时,该方法在LlamaGen和VQGAN架构上仅经过几百次微调迭代后,在质量和多样性指标上均显示出显著改进。

  19. RESEARCH · CL_133184 ·

    新方法修复了扩散模型中无分类器引导的不稳定性

    研究人员发现扩散模型中无分类器引导(CFG)存在一个关键问题,即高引导水平会导致过饱和和不稳定性。他们提出了一种新颖的修复机制,用修改后的版本替换标准的CFG公式,在不增加计算成本的情况下有效稳定了该过程。这种新方法在测试网格上相对于传统CFG取得了显著的改进,获得了9/9个FID点数胜利,并在稳定Stable Diffusion 1.5等模型的强引导场景方面显示出潜力。

  20. TOOL · CL_129223 ·

    新框架CIPHER解决医疗AI诊断中的偏见问题

    研究人员开发了一个名为CIPHER的新框架,以解决用于医学诊断的深度学习模型的性能差异问题。CIPHER干预了种族和性别等敏感属性可能影响图像内容的四个不同因果路径,而这是以前被忽视的复杂性。通过利用具有分类器自由引导和空文本反演的扩散模型,CIPHER可以重建患者解剖结构并合成反事实,以打破依赖链。在胸部X光和皮肤镜检查基准上的测试表明,与现有方法相比,CIPHER将最差组的差异平均减少了35.8%,同时还提高了整体诊断准确性。