Denoising Diffusion Implicit Models
PulseAugur coverage of Denoising Diffusion Implicit Models — every cluster mentioning Denoising Diffusion Implicit Models across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新方法增强扩散语言模型的并行解码 · 追踪6个来源
研究人员正在探索改进扩散语言模型(DLM)并行解码的新方法。一种方法,可靠并行解码(RPD),侧重于根据层级预测稳定性和最终置信度来选择候选,在LLaDA和Dream等基准测试中实现了更高的吞吐量,同时保持了准确性。另一种方法PUMBA引入了一个统一的轨迹感知训练框架,该框架使训练和推理条件保持一致,从而提高了性能并减少了所需函数评估的次数。此外,对“软标记”的研究正在被重新审视,并提出了一种新的几何感知构造,以更好地解释这些标记如何…
-
新的SANI框架通过像素级噪声注入增强扩散模型
研究人员推出了一种新的扩散模型框架——空间自适应噪声注入(SANI),该框架能够基于每个像素动态调整噪声应用。与传统均匀应用噪声的方法不同,SANI使用概率门控机制和导出的空间自适应方差,在需要精炼复杂特征的地方精确注入噪声,同时保留平滑区域。与标准DDPM和DDIM采样器相比,这种方法在不同时间步长上都持续提高了Fréchet Inception Distance(FID)分数。
-
新的三维流方法大幅缩短PET图像去噪时间
研究人员开发了一种新的三维条件校正流框架,称为3D Flow,用于高效去噪正电子发射断层扫描(PET)图像。该方法将推理时间显著缩短至约30秒,远优于现有需要数小时的3D深度扩散模型。该框架利用了优化的非均匀采样策略和单通道线性插值速度匹配目标。评估表明,即使在超低辐射剂量下,3D Flow也能实现良好的图像质量和病灶可见性,并且在独立临床数据集和不同剂量水平上显示出有希望的零样本迁移能力。
-
新的框架验证 AI 扩散模型的所有权
研究人员开发了一个名为“Membership is Ownership”(MiO)的新框架,用于验证大型扩散模型的所有权,这些模型是 OpenAI 和 Google 等公司的宝贵知识产权。与之前注入伪影到模型中并可能导致效用损失的方法不同,MiO 使用私有数据集上的总体水平假设检验,以最小的对模型性能的影响来确认所有权。该框架已证明对微调和权重扰动具有鲁棒性,为保护 AI 模型知识产权提供了更安全的解决方案。
-
AirLLM框架实现高效大模型远程微调
研究人员开发了AirLLM,一个用于在边缘设备上高效微调大语言模型(LLMs)的新框架。该方法通过采用分层扩散策略,解决了通信带宽和计算资源有限的挑战。AirLLM根据无线条件和语言复杂度自适应地确定LoRA参数配置,并使用去噪扩散隐式模型(Denoising Diffusion Implicit Models)来优化这些决策。实验表明,AirLLM显著降低了传输成本,同时提高了微调性能。
-
新的ACEF框架增强了AI生成图像的检测能力
研究人员开发了一个名为伪影互补专家融合(ACEF)的新颖框架,以改进AI生成图像的检测。该方法解决了当前依赖单一重建过程的技术的局限性,这可能导致伪影分布代表性不足。ACEF采用两阶段方法,首先通过LoRA适配创建特定于伪影的专家,然后使用自适应门控机制整合来自多种伪影类型的证据。在13个基准测试上的实验表明,ACEF在创建更具泛化性的AI生成图像检测模型方面非常有效。
-
新论文将扩散模型反演视为一个凸优化问题
一篇新论文引入了一个理解扩散模型的数学框架,特别关注反演过程。研究表明,一个隐式的DDIM反演步骤可以作为一个凸优化问题,揭示了模型对局部流形几何的编码方式。论文详细说明了反演解的唯一性条件,并识别了求解器的潜在失败点,为模型校准和错误检测提供了理论基础。
-
新研究解决了扩散模型水印和攻击方法问题
两篇新研究论文介绍了用于扩散模型水印和攻击现有水印的新颖方法。第一篇论文FARI提出了一个快速的单步逆转框架,提高了鲁棒性并显著减少了水印验证的处理时间。第二篇论文FDDWAN提出了一个频率解耦的扩散网络,旨在有效去除图像中的不可见水印,同时保持感知保真度。
-
新研究解决文本到视频和文本到图像扩散模型的局限性
两篇新研究论文解决了扩散模型在图像和视频生成方面的挑战。第一篇TPD引入了一个无需训练的框架,通过恢复被抑制的后期事件信号来改进文本到视频模型,从而在不重新训练的情况下增强时序连贯性和视觉保真度。第二篇论文Dualin提出了一种用于文本到图像模型的两阶段方法,该方法联合恢复语义提示和潜在噪声,旨在提高视觉保真度并实现精确的图像编辑。
-
新的LaP-Forensics框架通过多模态推理增强深度伪造检测能力
研究人员开发了LaP-Forensics,一个新颖的多模态框架,旨在通过结合视觉分析和基于重建的取证证据来改进深度伪造检测。该系统利用Stable Diffusion DDIM反演重建模型生成残差图,该图指示与重建图像的局部兼容性。然后,该残差信息与原始RGB图像一起由Where-What-Why模型处理,以产生文本分析并识别伪影。实验证明了其在跨生成器检测和既定基准上的伪影定位方面的有效性,尽管在自由形式文本忠实度和后处理下的可靠性…
-
新的 TIGA 框架生成可规避检测的 AI 生成图像
研究人员开发了 TIGA,一个旨在生成可规避 AI 生成内容 (AIGC) 检测器检测的图像的新框架。与修改已生成图像或需要检测器感知训练的现有方法不同,TIGA 使用扩散模型的采样轨迹将对抗性属性直接集成到图像生成过程中。这种方法无需源图像或重新训练扩散模型即可创建可规避检测的图像,同时保持高感知质量。
-
新算法\pddim 为逆问题提供可证明的基于扩散的后验采样
研究人员开发了一种名为\pddim的新算法,该算法使用扩散模型更有效地解决线性逆问题,并提供理论保证。该方法修改了标准的DDIM采样器,通过轻量级的、逐坐标的调整来整合测量模型。该算法通过分别考虑测量算子的每个奇异方向来从后验采样,并根据信噪比在扩散先验和基于测量的预测器之间切换。实证结果表明,\pddim在图像恢复任务中优于现有的基于扩散的后验采样器,提供了一种可证明一致且易于实现的解决方案。
-
新型AI模型DiffARFNO增强喷墨打印液滴预测
研究人员开发了一个名为DiffARFNO的新框架,以改进喷墨打印中液滴演化的预测。该两阶段模型结合了用于初始长时程预测的自回归傅里叶神经算子(Fourier-MIONet)和用于精炼这些预测的条件去噪扩散隐式模型(DDIM)。DDIM校正器迭代地去噪和精炼粗略预测,恢复精细细节。实验表明,DiffARFNO在源自Ansys Fluent的液滴数据集上显著优于现有方法。
-
新方法修复了扩散模型中无分类器引导的不稳定性
研究人员发现扩散模型中无分类器引导(CFG)存在一个关键问题,即高引导水平会导致过饱和和不稳定性。他们提出了一种新颖的修复机制,用修改后的版本替换标准的CFG公式,在不增加计算成本的情况下有效稳定了该过程。这种新方法在测试网格上相对于传统CFG取得了显著的改进,获得了9/9个FID点数胜利,并在稳定Stable Diffusion 1.5等模型的强引导场景方面显示出潜力。
-
LLM驱动的智能体自动化生物轨迹分析,新方法提高预测精度 · 跟踪6个来源
研究人员开发了SpaCellAgent,一个新颖的基于LLM的多智能体框架,旨在自动化空间和单细胞转录组学中的轨迹推断和分析。该框架旨在减少此类分析通常需要的手动干预,为时空建模提供端到端解决方案。据报道,SpaCellAgent在保持专家级性能的同时,分析效率提高了40%以上。此外,IMR和ECTraj等新方法正在推进多智能体轨迹预测在自动驾驶等应用中的发展,重点是提高准确性和降低推理延迟。
-
新型AI模型联合增强和分割医学图像
研究人员开发了DiSIINet,一种新颖的基于扩散的共生信息交互网络,旨在联合增强和分割医学图像。该方法基于去噪扩散隐式模型(DDIM),允许增强和分割分支通过共生信息交互(SII)模块进行迭代改进。通过在反向扩散过程中通过交叉注意力促进动态、特征级别的信息交换,DiSIINet旨在克服将这些任务分开处理的传统方法的局限性。在多模态医学数据集上的实验表明,与顺序或独立方法相比,性能有了显著提升。
-
论文通过Wasserstein几何统一扩散模型和流匹配
本文探讨了扩散模型和流匹配的底层几何学,揭示两者都受概率测度空间上二次Wasserstein距离的支配。研究提出,扩散模型遵循自由能的梯度流,类似于Fokker-Planck方程,而流匹配则学习Wasserstein空间中的测地线。通过在单一几何框架下统一这些模型,本文阐明了它们之间的关系,并提出流匹配的确定性ODE方法提供了更有效的采样方式。
-
新的扩散反演技术改进图像重建和地震分析 · 跟踪4个来源
研究人员正在开发新的扩散反演方法,该过程将图像映射回扩散模型的潜在空间以进行重建和编辑。一种方法“后验延续”(Posterior Continuation)根据噪声水平优化频带暴露,以提高各种任务的恢复性能。另一种方法“解耦潜在优化”(Decoupled Latent Optimization, DLO)通过解耦数据保真度和先验一致性来增强全波形反演,从而获得更真实的地球物理结构。此外,一种称为“时间步重排”(Timestep Res…
-
扩散模型理论揭示 DDIM 的幻觉弱点
一项新的理论分析研究了扩散模型中的幻觉现象,特别是比较了去噪扩散概率模型 (DDPM) 和去噪扩散隐式模型 (DDIM)。该研究证明 DDIM 在临界时间后可能会陷入模式之间,而 DDPM 的内在随机性有助于它避免这个问题。研究表明,引入额外的随机步骤可以提高 DDIM 的性能并减少幻觉。
-
DDIM创造者宋佳明离开Luma AI
加速图像生成的去噪扩散隐式模型(DDIM)的关键人物宋佳明已离开Luma AI。宋佳明于2023年在NVIDIA任职后加入Luma AI担任首席科学家,他在公司从3D生成转向视频和多模态模型的关键技术转变中发挥了至关重要的作用。他的离职正值Luma AI凭借Dream Machine和Uni-1.1等产品在多模态AI领域取得重大进展之际。