FFHQ
PulseAugur coverage of FFHQ — every cluster mentioning FFHQ across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新方法通过推测性采样技术加速人工智能推理 · 已追踪 2 个来源
两篇新的研究论文介绍了加速人工智能模型推理的方法。第一篇,Rank-Aware Speculative Sampling (RASS),通过对候选草稿进行排名并优化其选择以最小化与目标模型输出的差异,改进了现有基于树的推测性采样技术在扩散模型上的应用。在匹配的计算预算下,RASS 在 CIFAR-10 上的速度比 Diffusion Greedy Rejection Sampling (D-GRS) 快高达 20%。第二篇论文提出了 …
-
贝叶斯万能模型 (BAM) 提供物理感知生成成像
研究人员推出贝叶斯万能模型 (BAM),这是一种用于生成式计算成像的新型基础模型。BAM 旨在通过提供轻量级、可适应的解决方案,弥合大型通用图像模型与专业物理感知模型之间的差距。该模型拥有 3600 万个参数,只需极少的微调即可执行物理感知的后验采样,在各种数据集和逆问题上的样本质量和计算效率方面均优于现有方法。
-
新的AID方法通过扩散模型改进图像修复
研究人员开发了“分摊修复扩散模型”(Amortized Inpainting with Diffusion, AID),一种使用生成式扩散模型进行图像修复的新颖方法。AID修复预训练的扩散模型,并离线训练一个小型、可重用的引导模块,然后该模块可应用于掩码图像,无需进行实例优化。与现有方法相比,这种方法提供了改进的质量-速度权衡,且可训练的开销极小。
-
新的生成模型技术提高了AI内容创作的效率和质量 · 追踪4个来源
研究人员开发了新的单步生成建模方法,旨在提高AI生成内容的效率和质量。一种名为TDAction的方法,在优化参数实现成本的同时也优化了分布进展,在ImageNet上取得了较低的FID分数。另一种方法侧重于从短时间滞后学习随机动力学以预测长期演化,在凝聚态物理和驱动胶体方面显示出潜力。此外,还提出了一个使用离散Wasserstein几何和马尔可夫跳跃的框架,用于有限状态空间上的单步生成。还有一个名为SDM的免训练框架,通过调整求解器和时…
-
新的水印框架 VeriFi 通过内容恢复打击深度伪造
研究人员开发了一个名为 VeriFi 的新水印框架,旨在打击深度伪造和 AIGC 驱动的面部操纵的泛滥。该框架旨在通过实现高保真面部内容恢复来保护媒体来源、完整性和版权。VeriFi 嵌入了一个语义潜在水印,充当内容保留先验,即使在大幅修改后也能实现忠实恢复。它还通过将图像特征与解码的来源信号相关联来实现精确的定位,而无需专用有效载荷,从而为复杂的深度伪造流程提供强大的防御。
-
新的LAFR方法通过扩散模型增强盲人脸部修复
研究人员开发了LAFR,一种新颖的盲人脸部修复方法,可有效地将低质量图像的潜在表示与扩散模型先验对齐。与需要计算成本高昂的VAE重新训练的先前方法不同,LAFR使用基于码本的潜在空间适配器。与现有基线相比,该方法提高了感知质量、FID分数和身份一致性,同时显著减少了训练时间和计算需求。
-
新的RGFM生成模型使用重整化群流实现可扩展的局部数据生成
研究人员开发了重整化群流匹配(RGFM),一个新颖的生成建模框架,解决了计算成本与捕捉长程关联能力之间的权衡问题。RGFM通过使用精确的重整化群流作为概率路径,在不同空间尺度上构建数据生成过程,逐步从长波长结构生成到短波长结构。这种方法实现了局部生成建模,其计算成本几乎与系统体积呈线性关系,在生成连贯且高质量的样本方面优于传统的局部流匹配,尤其是在FFHQ等图像数据集上。
-
新的DiffSwap++方法增强了身份保持的人脸交换
研究人员开发了DiffSwap++,一种新的人脸交换扩散模型方法,显著提高了身份保持能力并减少了伪影。该方法在训练过程中融入了3D面部潜在特征,从而更好地将身份与姿势和表情分离开来。该系统以身份嵌入和面部地标为条件进行去噪过程,在CelebA、FFHQ和CelebV-Text等基准数据集上取得了高保真度的结果。使用生物识别风格指标和用户研究进行的评估进一步验证了其有效性。
-
新研究通过先进的一致性方法解决了视频对象和眼镜移除问题
两篇新研究论文介绍了先进的视频编辑方法,重点关注对象和眼镜的移除。第一篇论文《BeyondMasks》提出了一个新的视频对象移除基准和评估协议,该协议考虑了因果和物理一致性,超越了简单的图像修复。第二篇论文《Unwarping the Lens》提出了一种基于物理学的眼镜移除方法,利用一种新颖的迁移框架和一种称为JFSnet的专用网络来保持身份和时间稳定性。
-
新的扩散模型技术增强了数据同化和逆问题求解能力
研究人员开发了使用扩散模型改进数据同化和逆问题求解的新方法。其中一种方法,迭代细化(IR),将经典的预报-分析循环与生成式超分辨率相结合,从稀疏观测中重建高分辨率状态,在Kraichnan湍流等复杂物理系统上表现优于现有方法。另一种方法侧重于扩散逆问题的尺度一致后验动力学,在FFHQ和ImageNet等数据集上展示了超分辨率和去模糊等任务具有竞争力的重建保真度。
-
摩擦增强漂移模型增强了资源高效的域迁移
研究人员推出了一种新颖的域迁移方法——摩擦增强漂移模型(DMF),该方法显著提高了资源效率。DMF通过引入一个预定的摩擦系数来解决现有漂移模型(DMs)的局限性,该系数可防止模型进入局部排斥状态。与标准的DMs相比,该方法提高了合成保真度并降低了计算成本,其性能甚至可以与更复杂的方法(如最优流匹配(OFM))相媲美,同时所需的训练时间大大减少。
-
新理论PRISM改进了用于信号恢复的薛定谔桥模型
研究人员开发了PRISM,这是一个用于设计薛定谔桥模型中参考过程的新理论框架。该方法旨在通过超越参考过程的启发式选择来改进从退化观测中恢复信号,参考过程通常是具有手动调整时间表的白噪声。PRISM表征了时变的、可处理的高斯参考,并证明了一个“不可见性原理”,即在有限的计算资源下,最优参考与传感器所破坏的信息成正比。在高斯设置和FFHQ图像数据集上的实验证实了该理论的预测,尽管真实世界的图像统计数据揭示了模型失效的局限性。
-
新的DiffAttack方法使用扩散模型欺骗人脸识别系统
研究人员开发了一种名为DiffAttack的新方法,该方法利用潜在扩散模型为人脸识别系统创建对抗性样本。这种方法在扩散模型的潜在空间内进行优化,生成能够欺骗人脸识别模型的人脸,在FFHQ和CelebA-HQ等基准测试中取得了84.86%的攻击成功率。与现有方法相比,DiffAttack表现出更优越的可迁移性,其性能比传统的基于噪声的技术高出15%以上,比基于语义的方法高出约5%。
-
新研究探讨流匹配模型增强与漏洞 · 跟踪9个来源
研究人员正在探索增强流匹配模型的新方法,流匹配是生成任务的一种流行范式。一篇论文引入了“去噪加速”(accel)作为估计流匹配动作不确定性的免费代理,通过识别错误输出来提高实时控制的安全性,而无需额外的计算开销。另一项研究提出了“DRIFT”,一种对抗性补丁攻击,通过靶向去噪轨迹来有效破坏流匹配的视觉-语言-动作模型,揭示了其感知鲁棒性中令人惊讶的漏洞。此外,还提出了“单侧分位数耦合流匹配”(QC-FM)和“能量引导流匹配”(EG-F…
-
Diff-ID 框架通过身份一致性增强面部图像生成
研究人员开发了 Diff-ID,一个使用扩散模型生成具有一致身份保留的高分辨率面部图像的新框架。该系统将 ArcFace 和 CLIP 嵌入集成到一个经过微调的 Stable Diffusion UNet 中,并利用从 CelebA-HQ、FFHQ 和 LAION-Face 合成的数据集。虽然 Diff-ID 在身份相似性方面与 InstantID 相当,但根据 FID 和 FIQ 分数衡量,它提供了更高的真实感和更好的身份-真实感权…
-
StyleFusion360 可实现视图一致的 3D 头部风格化,无需针对每种风格进行训练
研究人员开发了 StyleFusion360,一种新的基于扩散的 3D 头部风格化框架。该方法允许从单个参考图像进行身份保留和视图一致的风格化,而无需针对每种风格进行训练。StyleFusion360 包含一个自适应风格调制机制和一个用户可控的滑块,用于调整风格化强度,并且还支持局部多编辑功能,可以独立修改头发或眼睛等特征。在 FFHQ 和 RenderMe360 数据集上的实验表明,StyleFusion360 在生成高质量、可控且…
-
新方法提升AI解决逆问题的能力
研究人员开发了一种名为精确后验分数(EPS)的新方法,用于利用扩散模型和流模型解决线性逆问题。该技术可以推导出线性高斯逆问题的精确后验分数闭式解,从而实现更准确的后验采样。EPS保留了去噪器标准的预训练结构,可以从头开始训练或对现有模型进行微调。在FFHQ和ImageNet数据集上的评估表明,EPS在保真度、感知质量和分布指标方面优于现有基线,同时所需的去噪器评估次数显著减少。
-
新的扩散反演技术改进图像重建和地震分析 · 跟踪4个来源
研究人员正在开发新的扩散反演方法,该过程将图像映射回扩散模型的潜在空间以进行重建和编辑。一种方法“后验延续”(Posterior Continuation)根据噪声水平优化频带暴露,以提高各种任务的恢复性能。另一种方法“解耦潜在优化”(Decoupled Latent Optimization, DLO)通过解耦数据保真度和先验一致性来增强全波形反演,从而获得更真实的地球物理结构。此外,一种称为“时间步重排”(Timestep Res…
-
新理论解释了用于成像逆问题的CNN
研究人员开发了一个新的理论框架,即局部等变MMSE(LE-MMSE)估计器,以更好地理解监督卷积神经网络(CNN)如何解决成像逆问题。该理论结合了平移等变性和局部性等关键CNN归纳偏置,提供了一个解析公式,该公式在各种任务和数据集上与训练网络的性能非常吻合。研究结果为物理感知估计器和物理无关估计器之间的差异以及训练数据特征的影响提供了见解。
-
新的高斯混合模型提高了 DDIM 采样质量
研究人员开发了一种新方法来改进去噪扩散隐式模型 (DDIM) 的采样过程。他们的方法利用高斯混合模型 (GMM) 作为反向转移算子,该算子匹配 DDPM 前向边际的一阶和二阶中心矩。该技术已被证明能够生成与原始 DDIM 相当或更高质量的样本,尤其是在使用少量采样步数的情况下。