PulseAugur
中
实时 05:00:46
实体 Latent Diffusion Models

Latent Diffusion Models

PulseAugur coverage of Latent Diffusion Models — every cluster mentioning Latent Diffusion Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
31
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
29
90 天内 29
层级分布 · 90 天
主题
时间线
  1. 2026-07-14 research_milestone Researchers introduced a new method for paragraph-level handwriting imitation using modified latent diffusion models, setting a new benchmark in style preservation. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/2 页 · 共 32 条
  1. RESEARCH · CL_258505 ·

    New JiT-DDT architecture trains text-to-image models 3.6x faster

    研究人员开发了一种新颖的 JiT-DDT 架构,可显著加速文本到图像扩散模型的训练。通过将压缩和生成模块统一到单个模型中,JiT-DDT 与之前的 Latent Diffusion Models (LDMs) 等方法相比,GPU 时间减少了 3.6 倍。即使在生成四倍像素分辨率的图像时,也实现了这种效率的提高。代码和模型权重在 Apache 2.0 许可下公开可用,鼓励对更有效的训练技术进行进一步研究。

  2. TOOL · CL_245699 ·

    新框架增强了用于医学影像分析的潜在扩散模型

    研究人员开发了一种新的微调框架,以改进预训练的潜在扩散模型在医学影像任务中的多模态对齐。该方法通过增强模型将文本描述与胸部X光片中的相应区域联系起来的能力,解决了医学领域数据可用性有限的问题。该方法在MS-CXR基准测试中取得了最先进的性能,并在VinDr-CXR等分布外数据上表现出鲁棒性,在短语定位和疾病分类方面具有潜在应用。

  3. TOOL · CL_228844 ·

    PhysWave 使用物理先验实现可控空间音频生成

    研究人员开发了 PhysWave,这是一种新颖的、由物理引导的潜在扩散模型,用于可控空间音频生成。该模型通过共享的航点-标题表示统一了自然语言和轨迹控制。通过整合用于球谐函数方向一致性和平方反比距离一致性的可微分声学先验,PhysWave 旨在生成符合物理声学原理的空间音频,从而提高在游戏和电影等应用中的可用性和精度。

  4. TOOL · CL_206661 ·

    研究质疑潜在扩散模型中引导方法的有效性

    一篇新的研究论文重新审视了潜在扩散模型中的无分类器引导(CFG)方法,在两个开源的修正流变换器上评估了八种无需训练的技术。研究发现,没有一种单一方法能在所有测量标准上持续提高图像质量,包括构图一致性和与文本提示的语义对应性。虽然APG取得了一些最高分,但提升幅度通常在评估不确定性范围内,而注意力扰动方法在不同模型上的结果好坏参半。

  5. TOOL · CL_205244 ·

    像 Stable Diffusion 这样的 AI 图像模型现在通过 TypeScript 在浏览器中运行

    ONNX Runtime Web 和 WebGPU 的最新进展使得像 Stable Diffusion 和 Flux 这样的复杂 AI 模型能够直接在浏览器中使用 TypeScript 运行。这一转变将 AI 模型执行从专用的后端基础设施转移到客户端或边缘设备,显著改变了全栈工程实践。文章详细介绍了潜在扩散模型(LDMs)和校正流匹配(Rectified Flow Matching)的机制,解释了它们如何在压缩的潜在空间中运行,并利用…

  6. TOOL · CL_191630 ·

    MiniMax AI 开源 VTP 框架用于生成模型

    MiniMax AI 已开源其视觉标记器预训练(VTP)框架,该框架旨在验证视觉标记器的缩放定律。该框架专为下一代生成模型而设计,并挑战了关于潜在扩散模型的传统观念。该公司 MiniMax(海螺)视频团队开发了 VTP,旨在向更广泛的 AI 行业展示其价值。

  7. RESEARCH · CL_193530 ·

    新的DeepFreqMark框架将水印嵌入AI图像

    研究人员开发了DeepFreqMark,一个用于将水印嵌入潜扩散模型(LDMs)生成的AI图像的新颖框架。与之前使用固定模式的方法不同,DeepFreqMark采用了可学习的神经编码器和解码器,以获得更大的容量和灵活性。该系统还引入了基于球形线性插值(Slerp)的攻击模拟,以克服训练瓶颈,实现了更低的比特错误率,并支持高达256比特的消息容量。

  8. TOOL · CL_187483 ·

    新方法实现虚拟试穿的可控服装生成

    一种用于虚拟试穿应用的新方法已被开发出来,该方法利用潜在扩散模型生成可控的服装图像。该方法使用精确的服装长度和样式标签来增强图像数据,从而实现更多样化和可控的图像输出。零售商可以利用这项技术来确保生成的图像准确地反映服装的合身度,从而避免误导消费者。

  9. TOOL · CL_185532 ·

    Flash-VAED 框架将视频生成速度提高 6 倍

    研究人员开发了 Flash-VAED,这是一个旨在加速用于视频生成的潜在扩散模型中的 VAE 解码器的框架。该方法采用通道剪枝和主导算子优化来降低推理成本,在保持高达 96.9% 的重建性能的同时,实现了约 6 倍的 VAE 解码速度提升。当集成到端到端生成管线中时,Flash-VAED 可将过程加速高达 36%,而对质量的影响极小,这在 VBench 2.0 等基准测试中得到了证明。

  10. RESEARCH · CL_181096 ·

    新的 AI 水印技术因安全担忧而出现 · 追踪 3 个来源

    研究人员开发了用于为 AI 生成图像添加水印的新方法,以确保真实性和防止伪造。一种名为 IRIS 的方法将水印绑定到图像的视觉语义上,使其能够抵抗移植和再生攻击。另一种方法 SpreadMark 利用神经网络架构内的扩频嵌入来创建鲁棒且不易察觉的水印。然而,另一项独立研究强调了语义水印系统中的一个漏洞,展示了如何使用 GhostVAE 的后门攻击在保持良性图像水印完整性的同时规避检测,这突显了这些系统对端到端安全的需求。

  11. TOOL · CL_178300 ·

    新的DiffAttack方法使用扩散模型欺骗人脸识别系统

    研究人员开发了一种名为DiffAttack的新方法,该方法利用潜在扩散模型为人脸识别系统创建对抗性样本。这种方法在扩散模型的潜在空间内进行优化,生成能够欺骗人脸识别模型的人脸,在FFHQ和CelebA-HQ等基准测试中取得了84.86%的攻击成功率。与现有方法相比,DiffAttack表现出更优越的可迁移性,其性能比传统的基于噪声的技术高出15%以上,比基于语义的方法高出约5%。

  12. TOOL · CL_165041 ·

    扩散模型推动医学图像修复进展,一项调查发现

    一篇最近发表在arXiv上的调查论文详细介绍了使用扩散模型进行医学图像修复的进展和挑战。该论文系统地回顾了60项研究,强调了研究兴趣的增长以及像去噪扩散概率模型和潜在扩散模型这类模型在重建缺失或损坏的医学图像数据方面的有效性。虽然这些模型在伪影去除和数据增强等应用中表现出强大的性能,尤其是在MRI和CT扫描中,但该调查也指出了关键挑战,包括缺乏标准化基准、数据集多样性有限以及在各种临床场景中的验证不足。

  13. RESEARCH · CL_178234 ·

    新研究探索用于生成、鲁棒性和速度的高级扩散模型

    研究人员正在为各种应用开发高级扩散模型,包括图像生成、时间序列合成和自然语言处理。Simplax 等新方法旨在通过使用辅助变量增强状态来改进分类生成,而 PhysDGM 将物理定律嵌入扩散模型中,用于动态系统中的真实时间序列数据合成。其他进展侧重于通过梯度掩蔽和空间压缩等技术增强扩散模型的对抗鲁棒性,并使用新颖的预测方法加速扩散 Transformer 的推理速度。此外,正在探索用于扩散模型更快采样以及开发平衡准确性和并行性的扩散大语…

  14. RESEARCH · CL_154640 ·

    新方法增强了扩散Transformer在图像生成中的多模态控制

    研究人员开发了新的方法来增强使用扩散Transformer(DiTs)的图像生成控制。一种方法,“Appearance Pointers”,使用紧凑型token来指导DiTs,实现对图像元素的精确区域控制,为本地化多模态引导提供了一种模态无关的接口。另一项开发,“DuSPiT”,引入了一种双分支架构,在像素空间扩散Transformer中将全局推理与局部外观建模分开,旨在获得更丰富的细节和更好的效率。对“Pixel-Space Dif…

  15. RESEARCH · CL_154053 ·

    新研究提升扩散语言模型的效率和语义 · 跟踪3个来源

    研究人员开发了新方法来改进扩散语言模型,解决了其效率和语义理解方面的局限性。其中一种方法 JUMP 通过实现对微调的离散扩散语言模型的单次传递分析来增强成员推理攻击,显著提高了准确性,优于先前的方法。另一项开发 CoDD 通过引入一个轻量级的概率推理层来解决“因子分解障碍”,该层允许在不增加过多参数的情况下实现更具表现力的联合分布,从而实现更快、更连贯的生成。此外,REGLUE 将视觉基础模型的全局和局部语义集成到潜在扩散模型中,提高…

  16. TOOL · CL_141796 ·

    新型扩散模型实现段落级手写模仿

    研究人员开发了一种新颖的段落级手写模仿方法,克服了现有模型主要生成单个单词或行的局限性。这种新方法利用了改进的潜在扩散模型,通过专门的损失函数和改进的注意力机制进行增强,以在生成的段落中保持一致性和布局。该方法在风格保持方面显著优于之前的基准,达到了 61% 的 mAP 和 56% 的 top-1 准确率,并且代码已公开提供,以支持进一步的研究和对策的开发。

  17. TOOL · CL_129528 ·

    GMODiff 框架使用扩散模型优化高动态范围重建

    研究人员开发了 GMODiff,一种用于高动态范围 (HDR) 重建的新型一次性扩散框架。该方法将 HDR 重建重新定义为增益图细化问题,利用预训练的潜在扩散模型 (LDM) 来编码扩展的动态范围,同时保持与标准低动态范围图像相同的比特深度。GMODiff 通过减轻内容幻觉和降低推理成本,解决了直接应用 LDM 的局限性,与之前的 LDM 方法相比,速度提高了 100 倍,同时保持了高感知质量和结构准确性。

  18. TOOL · CL_118107 ·

    新理论解释AI水印的伪造攻击

    研究人员开发了一个新的理论框架,以理解潜在扩散模型(LDM)中语义水印的脆弱性。他们的分析表明,不同模型之间的结构不匹配会产生不可约的失真下限,限制了伪造水印的保真度。这种失真表现为潜在流形上的几何偏差,而不是随机噪声。基于这些发现,该团队提出了一种检测方法,可以在水印验证之前识别伪造的样本,并在各种黑盒场景中证明了其有效性。

  19. RESEARCH · CL_115328 ·

    PixelU Transformer 提供高效的端到端像素扩散

    研究人员推出 PixelU,这是一种新颖的 U 型扩散 Transformer,专为高效的端到端像素扩散而设计。该模型通过关注 $x$-预测范式而非 $v$-预测,挑战了像素空间扩散中复杂解码器的必要性。PixelU 利用零成本跳跃连接直接路由高频细节,并采用恒定通道空间下采样机制来分离低频语义。在 ImageNet 上的实验表明,PixelU 在计算成本显著降低的情况下,取得了与现有方法相比具有竞争力的 FID 分数。

  20. TOOL · CL_110051 ·

    新的SSVAE方法将视频扩散模型训练速度提升3倍

    研究人员开发了一种名为谱结构VAE(SSVAE)的新方法,以提高视频生成中使用的潜在扩散模型的性能。通过分析视频变分自编码器(VAE)的潜在空间,他们确定了两个关键的谱属性——时空谱中的低频偏差以及由少数模式主导的通道 eigenspectrum——这对于高效的扩散训练至关重要。SSVAE通过引入两种轻量级正则化器,局部相关性正则化和潜在掩码重构,来实现这些属性。实验表明,与现有的开源VAE相比,SSVAE在文本到视频生成的收敛速度上…