Latent Diffusion Models
PulseAugur coverage of Latent Diffusion Models — every cluster mentioning Latent Diffusion Models across labs, papers, and developer communities, ranked by signal.
- 2026-07-14 research_milestone Researchers introduced a new method for paragraph-level handwriting imitation using modified latent diffusion models, setting a new benchmark in style preservation. 来源
7 天有情绪数据
-
研究质疑潜在扩散模型中引导方法的有效性
一篇新的研究论文重新审视了潜在扩散模型中的无分类器引导(CFG)方法,在两个开源的修正流变换器上评估了八种无需训练的技术。研究发现,没有一种单一方法能在所有测量标准上持续提高图像质量,包括构图一致性和与文本提示的语义对应性。虽然APG取得了一些最高分,但提升幅度通常在评估不确定性范围内,而注意力扰动方法在不同模型上的结果好坏参半。
-
像 Stable Diffusion 这样的 AI 图像模型现在通过 TypeScript 在浏览器中运行
ONNX Runtime Web 和 WebGPU 的最新进展使得像 Stable Diffusion 和 Flux 这样的复杂 AI 模型能够直接在浏览器中使用 TypeScript 运行。这一转变将 AI 模型执行从专用的后端基础设施转移到客户端或边缘设备,显著改变了全栈工程实践。文章详细介绍了潜在扩散模型(LDMs)和校正流匹配(Rectified Flow Matching)的机制,解释了它们如何在压缩的潜在空间中运行,并利用…
-
MiniMax AI 开源 VTP 框架用于生成模型
MiniMax AI 已开源其视觉标记器预训练(VTP)框架,该框架旨在验证视觉标记器的缩放定律。该框架专为下一代生成模型而设计,并挑战了关于潜在扩散模型的传统观念。该公司 MiniMax(海螺)视频团队开发了 VTP,旨在向更广泛的 AI 行业展示其价值。
-
新的DeepFreqMark框架将水印嵌入AI图像
研究人员开发了DeepFreqMark,一个用于将水印嵌入潜扩散模型(LDMs)生成的AI图像的新颖框架。与之前使用固定模式的方法不同,DeepFreqMark采用了可学习的神经编码器和解码器,以获得更大的容量和灵活性。该系统还引入了基于球形线性插值(Slerp)的攻击模拟,以克服训练瓶颈,实现了更低的比特错误率,并支持高达256比特的消息容量。
-
新方法实现虚拟试穿的可控服装生成
一种用于虚拟试穿应用的新方法已被开发出来,该方法利用潜在扩散模型生成可控的服装图像。该方法使用精确的服装长度和样式标签来增强图像数据,从而实现更多样化和可控的图像输出。零售商可以利用这项技术来确保生成的图像准确地反映服装的合身度,从而避免误导消费者。
-
Flash-VAED 框架将视频生成速度提高 6 倍
研究人员开发了 Flash-VAED,这是一个旨在加速用于视频生成的潜在扩散模型中的 VAE 解码器的框架。该方法采用通道剪枝和主导算子优化来降低推理成本,在保持高达 96.9% 的重建性能的同时,实现了约 6 倍的 VAE 解码速度提升。当集成到端到端生成管线中时,Flash-VAED 可将过程加速高达 36%,而对质量的影响极小,这在 VBench 2.0 等基准测试中得到了证明。
-
新的 AI 水印技术因安全担忧而出现 · 追踪 3 个来源
研究人员开发了用于为 AI 生成图像添加水印的新方法,以确保真实性和防止伪造。一种名为 IRIS 的方法将水印绑定到图像的视觉语义上,使其能够抵抗移植和再生攻击。另一种方法 SpreadMark 利用神经网络架构内的扩频嵌入来创建鲁棒且不易察觉的水印。然而,另一项独立研究强调了语义水印系统中的一个漏洞,展示了如何使用 GhostVAE 的后门攻击在保持良性图像水印完整性的同时规避检测,这突显了这些系统对端到端安全的需求。
-
新的DiffAttack方法使用扩散模型欺骗人脸识别系统
研究人员开发了一种名为DiffAttack的新方法,该方法利用潜在扩散模型为人脸识别系统创建对抗性样本。这种方法在扩散模型的潜在空间内进行优化,生成能够欺骗人脸识别模型的人脸,在FFHQ和CelebA-HQ等基准测试中取得了84.86%的攻击成功率。与现有方法相比,DiffAttack表现出更优越的可迁移性,其性能比传统的基于噪声的技术高出15%以上,比基于语义的方法高出约5%。
-
扩散模型推动医学图像修复进展,一项调查发现
一篇最近发表在arXiv上的调查论文详细介绍了使用扩散模型进行医学图像修复的进展和挑战。该论文系统地回顾了60项研究,强调了研究兴趣的增长以及像去噪扩散概率模型和潜在扩散模型这类模型在重建缺失或损坏的医学图像数据方面的有效性。虽然这些模型在伪影去除和数据增强等应用中表现出强大的性能,尤其是在MRI和CT扫描中,但该调查也指出了关键挑战,包括缺乏标准化基准、数据集多样性有限以及在各种临床场景中的验证不足。
-
新研究探索用于生成、鲁棒性和速度的高级扩散模型
研究人员正在为各种应用开发高级扩散模型,包括图像生成、时间序列合成和自然语言处理。Simplax 等新方法旨在通过使用辅助变量增强状态来改进分类生成,而 PhysDGM 将物理定律嵌入扩散模型中,用于动态系统中的真实时间序列数据合成。其他进展侧重于通过梯度掩蔽和空间压缩等技术增强扩散模型的对抗鲁棒性,并使用新颖的预测方法加速扩散 Transformer 的推理速度。此外,正在探索用于扩散模型更快采样以及开发平衡准确性和并行性的扩散大语…
-
新方法增强了扩散Transformer在图像生成中的多模态控制
研究人员开发了新的方法来增强使用扩散Transformer(DiTs)的图像生成控制。一种方法,“Appearance Pointers”,使用紧凑型token来指导DiTs,实现对图像元素的精确区域控制,为本地化多模态引导提供了一种模态无关的接口。另一项开发,“DuSPiT”,引入了一种双分支架构,在像素空间扩散Transformer中将全局推理与局部外观建模分开,旨在获得更丰富的细节和更好的效率。对“Pixel-Space Dif…
-
新研究提升扩散语言模型的效率和语义 · 跟踪3个来源
研究人员开发了新方法来改进扩散语言模型,解决了其效率和语义理解方面的局限性。其中一种方法 JUMP 通过实现对微调的离散扩散语言模型的单次传递分析来增强成员推理攻击,显著提高了准确性,优于先前的方法。另一项开发 CoDD 通过引入一个轻量级的概率推理层来解决“因子分解障碍”,该层允许在不增加过多参数的情况下实现更具表现力的联合分布,从而实现更快、更连贯的生成。此外,REGLUE 将视觉基础模型的全局和局部语义集成到潜在扩散模型中,提高…
-
新型扩散模型实现段落级手写模仿
研究人员开发了一种新颖的段落级手写模仿方法,克服了现有模型主要生成单个单词或行的局限性。这种新方法利用了改进的潜在扩散模型,通过专门的损失函数和改进的注意力机制进行增强,以在生成的段落中保持一致性和布局。该方法在风格保持方面显著优于之前的基准,达到了 61% 的 mAP 和 56% 的 top-1 准确率,并且代码已公开提供,以支持进一步的研究和对策的开发。
-
GMODiff 框架使用扩散模型优化高动态范围重建
研究人员开发了 GMODiff,一种用于高动态范围 (HDR) 重建的新型一次性扩散框架。该方法将 HDR 重建重新定义为增益图细化问题,利用预训练的潜在扩散模型 (LDM) 来编码扩展的动态范围,同时保持与标准低动态范围图像相同的比特深度。GMODiff 通过减轻内容幻觉和降低推理成本,解决了直接应用 LDM 的局限性,与之前的 LDM 方法相比,速度提高了 100 倍,同时保持了高感知质量和结构准确性。
-
新理论解释AI水印的伪造攻击
研究人员开发了一个新的理论框架,以理解潜在扩散模型(LDM)中语义水印的脆弱性。他们的分析表明,不同模型之间的结构不匹配会产生不可约的失真下限,限制了伪造水印的保真度。这种失真表现为潜在流形上的几何偏差,而不是随机噪声。基于这些发现,该团队提出了一种检测方法,可以在水印验证之前识别伪造的样本,并在各种黑盒场景中证明了其有效性。
-
PixelU Transformer 提供高效的端到端像素扩散
研究人员推出 PixelU,这是一种新颖的 U 型扩散 Transformer,专为高效的端到端像素扩散而设计。该模型通过关注 $x$-预测范式而非 $v$-预测,挑战了像素空间扩散中复杂解码器的必要性。PixelU 利用零成本跳跃连接直接路由高频细节,并采用恒定通道空间下采样机制来分离低频语义。在 ImageNet 上的实验表明,PixelU 在计算成本显著降低的情况下,取得了与现有方法相比具有竞争力的 FID 分数。
-
新的SSVAE方法将视频扩散模型训练速度提升3倍
研究人员开发了一种名为谱结构VAE(SSVAE)的新方法,以提高视频生成中使用的潜在扩散模型的性能。通过分析视频变分自编码器(VAE)的潜在空间,他们确定了两个关键的谱属性——时空谱中的低频偏差以及由少数模式主导的通道 eigenspectrum——这对于高效的扩散训练至关重要。SSVAE通过引入两种轻量级正则化器,局部相关性正则化和潜在掩码重构,来实现这些属性。实验表明,与现有的开源VAE相比,SSVAE在文本到视频生成的收敛速度上…
-
神经场自适应探索权重空间以增强AI表示
研究人员探索了将神经场权重用作有效表示的潜力,特别是在预训练模型和低秩自适应(LoRA)的约束下。这种被称为神经场自适应的方法在包括2D和3D数据的重建、生成和分析在内的各种任务中显示出有希望的结果。特别是,乘法LoRA权重表现出高质量的表示和语义结构,与现有的权重空间方法相比,提高了潜在扩散模型的生成质量。
-
新框架PeLAP-A剪枝潜在扩散模型,揭示“稀疏性崩溃”
研究人员推出PeLAP-A,一个旨在通过自适应剪枝潜在空间中不重要通道来使潜在扩散模型更轻量化的框架。该方法使用多层感知机预测通道重要性,创建一个软掩码,在特征被U-Net处理之前抑制相关性较低的特征。在CIFAR-10上进行有力的正则化测试时,PeLAP-A证明其可以在训练过程中将潜在通道驱动至接近零,同时与未剪枝模型相比,扩散损失和VAE重建精度得到提高。这种被称为“稀疏性崩溃”的现象表明,去噪U-Net在训练过程中对潜在通道的显…
-
FedOT框架增强了联邦LDM的归属验证和泄露追踪能力
研究人员推出FedOT,一个旨在验证联邦潜在扩散模型(LDM)的归属并追踪其泄露的新框架。该系统通过采用分块水印方法进行归属验证和客户端识别,解决了现有方法的漏洞。此外,FedOT采用潜在向量变换(LVT)技术,通过降低图像质量来防止水印移除攻击(如果VAE被替换),从而确保模型的完整性和可追溯性。