Diffusion Models
PulseAugur coverage of Diffusion Models — every cluster mentioning Diffusion Models across labs, papers, and developer communities, ranked by signal.
- instance of IArxiv 90%
- instance of IArxiv Recommender 90%
- instance of Generative Modeling 90%
- instance of Celeba 90%
- used by HunyuanVideo 80%
- used by classifier-free guidance (CFG) 80%
- used by SD3.5 80%
- instance of Normalizing Flows 70%
- used by Classifier Free Guidance 70%
- instance of Influence Flower 70%
- instance of autoregressive model 70%
- instance of Diffusion Transformer 70%
- 2026-06-05 research_milestone A new paper explores predicting human preference for text-to-image generations before creation. 来源
15 天有情绪数据
-
生成式人工智能调查报告详述了自动驾驶领域的前沿与机遇
一篇新的调查论文探讨了生成式人工智能(GenAI)在自动驾驶领域的应用,特别关注实现L5级别自动驾驶。该论文详细介绍了各种生成模型,如VAEs、GANs、Diffusion Models和LLMs,以及它们在生成合成数据、实现端到端驾驶策略和创建智能交通网络方面的应用。论文还讨论了泛化性、安全性、伦理关切和监管合规性等挑战,并提出了未来的研究方向。
-
扩散模型通过关系抽象增强空间推理能力 · arXiv
研究人员开发了一个新框架,以增强扩散模型的空间推理能力。该方法使用无监督对象发现和对象关系抽象,为扩散模型注入结构化原语。这些原语有助于指导生成表示空间,使模型能够满足推理约束,并生成符合逻辑规则的图像,尤其是在解谜场景中。该框架还引入了一个新的生成空间推理基准数据集,展示了模型性能和泛化能力的显著提升。
-
Rectified flow models achieve optimal sample complexity, paper shows
一篇新发表在arXiv上的论文介绍了流匹配生成模型的一种——校正流模型(rectified flow models)的理论进展。该研究证明了这些模型可以达到最优的样本复杂度\(\tilde{O}(\varepsilon^{-2})\),优于现有的流匹配模型界限。这一理论发现为校正流模型观察到的强大实证性能提供了数学解释,特别是它们能够以最少的采样步骤生成高质量结果的能力。
-
OrthoGen:一种用于时变治疗的新型生成正交学习器
研究人员开发了 OrthoGen,这是一种新颖的生成正交学习器,旨在估计时变治疗场景下的条件分布潜在结果 (CDPOs)。该方法解决了医疗应用中时变混杂因素带来的挑战,例如预测不同治疗序列下患者的特定风险。OrthoGen 采用生成递归 g 估计调整策略,直接对结果分布进行建模,提供双重稳健性和准最优效率。该框架具有灵活性,能够集成各种生成模型,如正态流和扩散模型,并在合成、半合成和真实世界数据集上证明了其有效性。
-
新的DDT-RFE方法增强了用于图像任务的扩散模型
研究人员开发了一种名为DDT-RFE的新方法,通过修改解耦扩散Transformer (DDT) 来改进扩散模型。该方法消除了编码器块中的残差连接,实现了更渐进的特征抽象。通过融合输入块嵌入与中间和最终编码器特征,解码器可以访问多深度信息,从而在各种视觉理解任务上提高性能,并在ImageNet上提高图像生成质量。
-
新框架量化扩散模型中的特征生成
研究人员开发了一个名为特征信息动力学的新信息论框架,用于分析生成模型中扩散过程期间特征的生成方式。该框架量化了特定特征何时出现,并将信息变化率与去噪损失的差异联系起来。该方法可以区分不同的扩散模型架构,并表明有序生成可能会提高训练效率。
-
新型扩散模型解决不平衡数据以用于欺诈检测
研究人员推出了一种名为 Quantile-TabDDPM 的新型扩散模型,旨在解决金融科技和医疗保健等领域常见的、高度不平衡的表格数据挑战。标准的扩散模型由于其二次误差损失而难以处理偏斜数据集,因为它会忽略罕见的、关键的实例。Quantile-TabDDPM 通过在标准目标之外加入分位数损失项来增强这些模型,从而能够更好地捕捉极端值和少数类。在真实的信用卡交易数据集上的评估证明了其在欺诈检测方面的有效性。
-
新方法延迟扩散模型记忆,延长泛化能力
研究人员开发了一种名为质量门控去白化(QGD)的新方法,用于控制扩散模型中训练数据的记忆。该技术旨在延迟模型开始复制训练样本的时间点,从而延长有用泛化的周期。QGD通过保持快速的初始更新阶段,然后逐渐恢复动量来工作,并通过分析将不同类型的记忆分开。在CIFAR-10子集上进行测试时,QGD显著扩展了扩散模型的有用区间,并与标准SGD相比减少了复制,同时还实现了更好的FID分数。
-
新的ANCRe框架优化神经网络深度缩放
研究人员推出了一种新颖的ANCRe框架,旨在优化神经网络的深度缩放。通过自适应地学习和重新分配残差连接,ANCRe旨在以最小的计算开销提高更深层网络层的利用率。在大型语言模型、扩散模型和深度ResNets上的实验表明,与传统的残差连接方法相比,ANCRe可以加速收敛、提高性能并增加深度效率。
-
新研究探讨AI图像水印的鲁棒性和移除技术
两篇新研究论文探讨了AI生成图像的水印技术的局限性和潜在改进。第一篇论文来自arXiv,从理论上分析了基于潜在空间的扩散模型水印方法,揭示了其在面对旋转和缩放等常见图像失真时的固有鲁棒性局限性。第二篇论文介绍了LiBRA,一种通过优化自编码器潜在空间来移除AI生成图像水印的新方法,旨在使水印不可检测,同时保持图像质量。
-
新的网络世界模型加速复杂系统算法设计
研究人员开发了一种新颖的、受动作条件约束的网络世界模型,旨在预测复杂系统中随时间推移的扩散动态。该模型充当了用于选择以最大化性能的算法的快速评估器,特别是在结果并非立竿见影的情况下,例如机器人技术或流行病控制。通过与编码代理集成,该系统利用模拟和反事实分析的反馈来改进算法,在各种任务和扩散模型上实现了与现有基线相当或更好的性能,同时显著减少了模拟时间。
-
谱方法利用切比雪夫多项式加速扩散模型采样
研究人员开发了一种名为 Spectrum 的新颖的无需训练的方法,用于加速扩散模型采样。该方法通过用切比雪夫多项式近似未来扩散步骤中的潜在特征来预测它们,从而实现改进的远距离特征重用和受控误差。与现有方法相比,Spectrum 在 FLUX.1 上实现了高达 4.79 倍的加速,在 Wan2.1-14B 上实现了 4.67 倍的加速,同时保持了高质量的样本。
-
Delta-K 框架提升扩散模型中的多实例生成
研究人员推出了一种新颖的推理框架 Delta-K,旨在增强扩散模型中复杂多实例场景的生成。这种即插即用方法通过增强交叉注意力的 Key 空间来工作,专门针对并注入缺失概念的语义签名。通过使用轻量级的视觉语言模型,Delta-K 分离出差分键($\Delta K$),然后将其集成到生成过程的早期,将噪声稳定地构建成结构,而不会改变现有概念。实验表明,Delta-K 在不使用空间掩码或额外训练的情况下,提高了 DiT 和 U-Net 等各…
-
Fenchel Tilting 实现了生成模型的有效微调
研究人员推出了一种新颖的方法 Fenchel Tilt Flow Control (FTFC),用于有效微调生成模型以使其符合特定的效用函数。该方法将效用优化与模型拟合分离开来,使模型能够在没有复杂优化过程的情况下适应多样化的偏好。FTFC 在图像和分子生成基准测试中显示出比现有方法显著的改进,效率提高了 20 倍,同时保持了鲁棒性。
-
通过尺度空间动力学和记忆追踪分析扩散模型
研究人员提出了一种看待扩散模型的新视角,将其视为由噪声尺度索引的确定性动力系统,而不仅仅是随机过程。这种方法允许将固定尺度去噪器作为自映射进行研究,其中不动点对应于平滑数据密度的临界点,吸引子代表模式。样本在噪声水平增加下的持久性,由临界尺度 $\sigma_c$ 量化,可能表明由于重复、过拟合或异常值导致的记忆。对 Stable Diffusion 等模型的实验表明,该临界尺度能有效追踪记忆,并提供对图像空间分布和字幕依赖性的见解。
-
扩散模型在逆向设计和优化任务中得到增强 · 跟踪到2个来源
研究人员开发了新方法来提高扩散模型在逆向设计问题中的效率和准确性。一种方法是仿真器精炼扩散(SRD),它结合了低保真可微分代理和高保真不可微分仿真器,以增强满足特定电磁要求的印刷电路板布局的生成。另一种方法OptDiff,基于RED-diff框架,将后验采样重新表述为优化问题,简化了超参数调整并加速了图像重建和去模糊等任务的推理。
-
Diffusion models generate creative chess puzzles with improved uniqueness
研究人员开发了一种使用掩码扩散模型生成创意国际象棋谜题的新颖方法,解决了当前语言模型在受约束的创意任务中的局限性。他们的方法允许基于特定的战术主题和部分棋盘位置进行条件化,将解决方案的独特性提高了 11.6%,主题条件准确性提高了 2.5%。通过基于 Denoising Diffusion Policy Optimization (DDPO) 的强化学习框架进一步优化,将独特且主题匹配的位置产量提高了 89.1%。该团队还发布了该任务…
-
新方法可根据用户历史记录进行个性化图像生成 · 跟踪到2个来源
研究人员开发了新的个性化图像生成方法,超越了简单的基于视觉示例的条件合成。这些方法旨在通过分析用户的历史数据(包括图像、标题和元数据)来捕捉用户的独特身份和偏好。一个提出的系统PEARL在交错循环中使用多模态推理器,在个性化指标上实现了15%的改进。另一种方法侧重于直接从历史图像对中学习用户偏好,在预测保留的偏好方面达到77%的准确率,并通过保持扩散模型冻结来提高与用户品味的匹配度。
-
扩散模型研究探索采样效率和复杂性界限 · 2篇论文
两篇新研究论文探讨了扩散模型的理论基础,重点关注采样效率和复杂性。第一篇论文建立了扩散采样的分数查询下界,证明算法需要与数据维度相关的显著数量的查询。第二篇论文深入研究了使用离散扩散的分类马尔可夫随机场的样本复杂性界限,引入了一种新颖的分数“固定分解”和一种权重共享的神经分数学习器,该学习器在某些模型上表现出改进的性能。
-
新研究通过分布稳定性和排名渐进性探索AI公平性 · 3个来源已追踪
三篇新研究论文在arXiv上发表,探索了算法公平性的新方法。第一篇论文介绍了一种为图像生成去偏扩散模型的方法,在不要求敏感属性标注的情况下,同时解决公平性和多样性问题。第二篇论文将公平性定义为分布稳定性,提出了一种评估预测器在受保护群体扰动下的稳定性并提供泛化界限的方法。第三篇论文提出了一个基于排名的框架“排名渐进性公平性”(Rank Graduation Fairness),通过模型预测误差来评估公平性,并将其与准确性和可解释性联系…