Denoising Diffusion Implicit Models
PulseAugur coverage of Denoising Diffusion Implicit Models — every cluster mentioning Denoising Diffusion Implicit Models across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新研究解决了扩散模型水印和攻击方法问题
两篇新研究论文介绍了用于扩散模型水印和攻击现有水印的新颖方法。第一篇论文FARI提出了一个快速的单步逆转框架,提高了鲁棒性并显著减少了水印验证的处理时间。第二篇论文FDDWAN提出了一个频率解耦的扩散网络,旨在有效去除图像中的不可见水印,同时保持感知保真度。
-
新研究解决文本到视频和文本到图像扩散模型的局限性
两篇新研究论文解决了扩散模型在图像和视频生成方面的挑战。第一篇TPD引入了一个无需训练的框架,通过恢复被抑制的后期事件信号来改进文本到视频模型,从而在不重新训练的情况下增强时序连贯性和视觉保真度。第二篇论文Dualin提出了一种用于文本到图像模型的两阶段方法,该方法联合恢复语义提示和潜在噪声,旨在提高视觉保真度并实现精确的图像编辑。
-
新的LaP-Forensics框架通过多模态推理增强深度伪造检测能力
研究人员开发了LaP-Forensics,一个新颖的多模态框架,旨在通过结合视觉分析和基于重建的取证证据来改进深度伪造检测。该系统利用Stable Diffusion DDIM反演重建模型生成残差图,该图指示与重建图像的局部兼容性。然后,该残差信息与原始RGB图像一起由Where-What-Why模型处理,以产生文本分析并识别伪影。实验证明了其在跨生成器检测和既定基准上的伪影定位方面的有效性,尽管在自由形式文本忠实度和后处理下的可靠性…
-
新的 TIGA 框架生成可规避检测的 AI 生成图像
研究人员开发了 TIGA,一个旨在生成可规避 AI 生成内容 (AIGC) 检测器检测的图像的新框架。与修改已生成图像或需要检测器感知训练的现有方法不同,TIGA 使用扩散模型的采样轨迹将对抗性属性直接集成到图像生成过程中。这种方法无需源图像或重新训练扩散模型即可创建可规避检测的图像,同时保持高感知质量。
-
新算法\pddim 为逆问题提供可证明的基于扩散的后验采样
研究人员开发了一种名为\pddim的新算法,该算法使用扩散模型更有效地解决线性逆问题,并提供理论保证。该方法修改了标准的DDIM采样器,通过轻量级的、逐坐标的调整来整合测量模型。该算法通过分别考虑测量算子的每个奇异方向来从后验采样,并根据信噪比在扩散先验和基于测量的预测器之间切换。实证结果表明,\pddim在图像恢复任务中优于现有的基于扩散的后验采样器,提供了一种可证明一致且易于实现的解决方案。
-
新型AI模型DiffARFNO增强喷墨打印液滴预测
研究人员开发了一个名为DiffARFNO的新框架,以改进喷墨打印中液滴演化的预测。该两阶段模型结合了用于初始长时程预测的自回归傅里叶神经算子(Fourier-MIONet)和用于精炼这些预测的条件去噪扩散隐式模型(DDIM)。DDIM校正器迭代地去噪和精炼粗略预测,恢复精细细节。实验表明,DiffARFNO在源自Ansys Fluent的液滴数据集上显著优于现有方法。
-
新方法修复了扩散模型中无分类器引导的不稳定性
研究人员发现扩散模型中无分类器引导(CFG)存在一个关键问题,即高引导水平会导致过饱和和不稳定性。他们提出了一种新颖的修复机制,用修改后的版本替换标准的CFG公式,在不增加计算成本的情况下有效稳定了该过程。这种新方法在测试网格上相对于传统CFG取得了显著的改进,获得了9/9个FID点数胜利,并在稳定Stable Diffusion 1.5等模型的强引导场景方面显示出潜力。
-
LLM驱动的智能体自动化生物轨迹分析,新方法提高预测精度 · 跟踪6个来源
研究人员开发了SpaCellAgent,一个新颖的基于LLM的多智能体框架,旨在自动化空间和单细胞转录组学中的轨迹推断和分析。该框架旨在减少此类分析通常需要的手动干预,为时空建模提供端到端解决方案。据报道,SpaCellAgent在保持专家级性能的同时,分析效率提高了40%以上。此外,IMR和ECTraj等新方法正在推进多智能体轨迹预测在自动驾驶等应用中的发展,重点是提高准确性和降低推理延迟。
-
新型AI模型联合增强和分割医学图像
研究人员开发了DiSIINet,一种新颖的基于扩散的共生信息交互网络,旨在联合增强和分割医学图像。该方法基于去噪扩散隐式模型(DDIM),允许增强和分割分支通过共生信息交互(SII)模块进行迭代改进。通过在反向扩散过程中通过交叉注意力促进动态、特征级别的信息交换,DiSIINet旨在克服将这些任务分开处理的传统方法的局限性。在多模态医学数据集上的实验表明,与顺序或独立方法相比,性能有了显著提升。
-
论文通过Wasserstein几何统一扩散模型和流匹配
本文探讨了扩散模型和流匹配的底层几何学,揭示两者都受概率测度空间上二次Wasserstein距离的支配。研究提出,扩散模型遵循自由能的梯度流,类似于Fokker-Planck方程,而流匹配则学习Wasserstein空间中的测地线。通过在单一几何框架下统一这些模型,本文阐明了它们之间的关系,并提出流匹配的确定性ODE方法提供了更有效的采样方式。
-
新的扩散反演技术改进图像重建和地震分析 · 跟踪4个来源
研究人员正在开发新的扩散反演方法,该过程将图像映射回扩散模型的潜在空间以进行重建和编辑。一种方法“后验延续”(Posterior Continuation)根据噪声水平优化频带暴露,以提高各种任务的恢复性能。另一种方法“解耦潜在优化”(Decoupled Latent Optimization, DLO)通过解耦数据保真度和先验一致性来增强全波形反演,从而获得更真实的地球物理结构。此外,一种称为“时间步重排”(Timestep Res…
-
扩散模型理论揭示 DDIM 的幻觉弱点
一项新的理论分析研究了扩散模型中的幻觉现象,特别是比较了去噪扩散概率模型 (DDPM) 和去噪扩散隐式模型 (DDIM)。该研究证明 DDIM 在临界时间后可能会陷入模式之间,而 DDPM 的内在随机性有助于它避免这个问题。研究表明,引入额外的随机步骤可以提高 DDIM 的性能并减少幻觉。
-
DDIM创造者宋佳明离开Luma AI
加速图像生成的去噪扩散隐式模型(DDIM)的关键人物宋佳明已离开Luma AI。宋佳明于2023年在NVIDIA任职后加入Luma AI担任首席科学家,他在公司从3D生成转向视频和多模态模型的关键技术转变中发挥了至关重要的作用。他的离职正值Luma AI凭借Dream Machine和Uni-1.1等产品在多模态AI领域取得重大进展之际。
-
新的高斯混合模型提高了 DDIM 采样质量
研究人员开发了一种新方法来改进去噪扩散隐式模型 (DDIM) 的采样过程。他们的方法利用高斯混合模型 (GMM) 作为反向转移算子,该算子匹配 DDPM 前向边际的一阶和二阶中心矩。该技术已被证明能够生成与原始 DDIM 相当或更高质量的样本,尤其是在使用少量采样步数的情况下。
-
ExpoCM框架加速HDR图像重建
研究人员开发了ExpoCM,一个用于从单个低动态范围输入重建高动态范围(HDR)图像的新框架。该方法通过将问题重新表述为概率流ODE来解决过曝区域细节丢失和欠曝区域噪声的问题。ExpoCM使用曝光感知一致性轨迹和曝光引导损失函数,与现有的扩散模型相比,提高了图像质量并显著加快了推理时间。
-
用于视频生成的扩散模型
研究人员正在探索用于视频生成的先进扩散模型,以解决时间一致性和数据稀缺性等挑战。新方法侧重于改进参数化,例如 v-prediction 技术,并结合条件采样来完成扩展视频长度或填充缺失帧等任务。同时,通过训练后框架、混合注意力机制和语义视觉适应性,也在努力提高效率和可控性,目标是实现实时生成和更高质量的输出。