text-to-image diffusion models
PulseAugur coverage of text-to-image diffusion models — every cluster mentioning text-to-image diffusion models across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
撤回的论文评估文本到图像模型中的 NSFW 概念擦除
一篇已被撤回的研究论文旨在对文本到图像扩散模型中擦除不安全内容(NSFW)的方法进行全面评估。作者开发了一个全流程工具包,以系统地研究这些概念擦除技术。他们的目标是通过提高内容安全性,为安全部署扩散模型提供见解和实践指导。
-
PoseAdapter框架提升多目标图像生成精度
研究人员开发了PoseAdapter,一个旨在提高复杂多目标场景图像生成精度的创新框架。该系统利用高效的条件布局,整合了单独的对象标题、2D边界框和3D角度,以建立精确的空间和角度锚点。PoseAdapter通过上下文感知双流表示解决了严格实例隔离与全局连贯性之间的平衡问题,该表示将局部和关系场景令牌注入现代MM-DiT架构。与现有方法相比,该框架在空间精度、方向精度和多目标视觉保真度方面表现出卓越的性能。
-
新方法学习文本到图像扩散模型的动态引导时间表
研究人员开发了一种学习文本到图像扩散模型中动态引导时间表的新颖方法。当前模型通常使用静态的全局引导尺度,这可能不是最优的并导致伪影。这种新方法训练一个判别器来估计真实分布和引导分布之间的时间依赖性密度比,从而使生成器网络能够预测最优的、状态依赖的引导尺度。在文本到图像生成基准上的实证结果表明,该方法优于启发式时间表和先前动态引导技术。
-
新方法可在无水印情况下为AI图像模型打上指纹
研究人员开发了一种新颖的方法,可以在不嵌入水印的情况下为文本到图像的扩散模型打上指纹。这项技术在arXiv预印本中有所详述,它利用了一种称为“塌缩生成”的现象,在这种现象中,特定的输入条件会在不同的随机种子下持续生成相似的图像。这些模型依赖的签名可用于验证所有权,即使模型是通过黑盒API访问或经过微调的。该框架已证明在区分不同扩散模型和抵御混淆尝试方面具有有效性。
-
新的PEAK框架可精确擦除文本到图像模型中的概念
研究人员开发了PEAK,一个用于精确持久地擦除文本到图像扩散模型中概念的新框架。该方法利用k稀疏自编码器(kSAEs)将密集表示分解为可解释的稀疏特征。通过识别并选择性地抑制目标特定特征,同时保留其他特征,PEAK旨在防止意外的语义干扰和被擦除概念的对抗性恢复。实验表明,PEAK显著减少了敏感内容的检测,并保持了生成质量。
-
新的OPAD框架为一步扩散模型提供可靠的个性化
研究人员开发了一个名为OPAD(One-step Personalized Adversarial Distillation)的新框架,以改进一步文本到图像扩散模型的个性化。现有方法在定制这些更快的模型时遇到困难,常常导致效果不佳。OPAD结合了教师-学生蒸馏和对抗性监督,使一步学生模型能够从多步教师模型中学习,同时与真实图像分布对齐。这种方法首次在保持一步扩散模型效率的同时,可靠地实现了高质量的个性化。
-
新方法在生成过程中自适应文本到图像模型
研究人员推出了一种名为“循环内模型自适应”(IMA)的新型文本到图像扩散模型方法。该技术允许模型在图像生成过程本身中适应来自参考图像的特定主题,而无需预训练或长时间微调。IMA 利用 DDIM 反演链和文本到图像生成链,并通过耦合潜在噪声损失进行引导,该损失可保留主题身份和文本提示对齐,从而获得高保真结果。
-
新研究解决文本到视频和文本到图像扩散模型的局限性
两篇新研究论文解决了扩散模型在图像和视频生成方面的挑战。第一篇TPD引入了一个无需训练的框架,通过恢复被抑制的后期事件信号来改进文本到视频模型,从而在不重新训练的情况下增强时序连贯性和视觉保真度。第二篇论文Dualin提出了一种用于文本到图像模型的两阶段方法,该方法联合恢复语义提示和潜在噪声,旨在提高视觉保真度并实现精确的图像编辑。
-
新框架UniNDM针对AI图像生成中的隐式性内容
研究人员开发了UniNDM,一个旨在检测和缓解文本到图像扩散模型生成不当性内容的新颖框架。该系统利用扩散过程中噪声的固有属性,识别出早期噪声可以有效地区分正常内容和露骨内容。UniNDM包含一个轻量级的基于噪声的检测器和一个自适应的负面提示机制,通过大型语言模型进行增强,以处理各种隐式提示。该框架在U-Net和Diffusion Transformer架构上都显示出比现有方法显著的改进。
-
新的PersGuard框架使用模型后门来保护文本到图像AI
研究人员开发了PersGuard,一个旨在防止文本到图像扩散模型恶意个性化的新框架。与需要扰乱训练图像的先前方法不同,PersGuard在模型发布前将保护性后门嵌入模型中。这些后门确保如果模型在受保护的图像上进行微调,它将生成预定义的保护性输出,而未受保护的图像则导致正常的模型效用。实验表明,与现有方法相比,PersGuard提供了卓越的隐私保护。
-
新的TILDE方法实现了文本到图像模型中的概念遗忘
研究人员开发了一种新的概念遗忘方法TILDE(TILt-based Distributional Erasure),用于文本到图像扩散模型。该技术解决了在不影响模型生成良性内容整体质量和多样性的情况下,移除特定概念(如受版权保护的风格或私人信息)的挑战。TILDE将遗忘问题构建为分布对齐问题,旨在抑制不需要的概念,同时不负面影响模型生成其他广泛内容的能力。
-
新的AEGIS防御机制应对文本到图像模型中的视觉同义词攻击 · 跟踪3个来源
研究人员开发了AEGIS,这是一种新颖的防御机制,旨在对抗文本到图像扩散模型中的视觉同义词攻击(VSA)。与以往专注于明确不安全概念的方法不同,AEGIS动态追踪禁止的语义在生成过程中如何出现。通过识别充当不安全视觉语义瓶颈的特定注意力头,AEGIS应用有针对性的排斥来提高安全性和可用性,而不会压制良性概念。该系统已在SD 1.4和SD 2.1等模型上证明了有效性,显著降低了攻击成功率。
-
新框架为AI数据生成物理精确的镜像反射
研究人员开发了PhysMirror,一个旨在生成图像中物理精确镜像反射的新框架。该方法解决了当前文本到图像扩散模型的一个关键限制,这些模型经常产生几何上不正确的反射,阻碍了它们在具身AI中用于合成数据生成。PhysMirror通过将提示的对象提升到3D网格并模拟镜像场景,整合了显式的3D空间先验,提取精确的2D条件元素(如深度和分割图)来指导扩散模型。该框架还引入了一个新颖的指标,镜像一致性分数(MCS),以自动量化反射的物理正确性。
-
新的SAGE方法改进了文本到图像模型的安全对齐
一篇新发表在arXiv上的研究论文介绍了一种名为结构感知几何正则化(SAGE)的新方法,用于改进文本到图像扩散模型的安全对齐。目前的对齐技术常常依赖FID和CLIPScore等粗略指标,从而产生“高实用性错觉”,掩盖了语义准确性的显著下降。SAGE通过显式保留文本编码器提示嵌入的分布和关系结构来解决这个问题,从而在TIFA测量的结构化实用性方面取得了显著改进,同时保持了强大的安全性能。
-
新基准数据集旨在检测合成灾难图像
研究人员推出了“Forged Calamity”,一个旨在提高文本到图像扩散模型生成的合成灾难图像检测能力的新基准数据集。该数据集包含 30,000 张图像,其中 6,000 张为真实图像,24,000 张为由四种不同扩散模型生成的合成样本。实验表明,当前的取证方法在泛化能力方面存在不足,在遇到来自未见过生成器或灾难类型的图像时,准确率会显著下降,这凸显了对更鲁棒、与模型无关的检测技术的需求。
-
ZIPP 使能够使用基于角色的 LLM 提示进行个性化图像生成
研究人员开发了 ZIPP,一种新颖的零样本图像个性化方法,该方法将文本到图像的扩散模型条件化为自然语言角色。这种方法无需任何用户特定数据或模型权重更新即可实现个性化图像生成,解决了冷启动问题和上下文相关的偏好。ZIPP 利用大型语言模型从角色的角度重写提示,并使用在大型 Reddit 交互图上训练的图注意力网络大规模挖掘角色。该系统在新的基准 ZIPBench 上进行了评估,与通用生成和微调基线相比,在个性化方面取得了显著改进,并减少…
-
新型后门绕过AI概念擦除,暴露有害内容
研究人员发现了一种针对文本到图像扩散模型的概念擦除技术(concept erasure techniques)的重大漏洞,称为擦除规避后门(Erasure Evasion Backdoor, EEB)。该后门允许攻击者嵌入一个与待删除概念相关联的隐藏触发器,从而确保即使在尝试擦除后,仍能生成与该概念相关的有害内容。EEB被证明对多种最先进的擦除方法都有效,在生成不受欢迎的输出方面取得了很高的成功率,包括名人肖像和露骨图像。
-
扩散模型驱动新的无监督视觉对象跟踪方法
研究人员开发了一种名为Diff-Tracking的新方法,该方法利用文本到图像的扩散模型进行无监督视觉对象跟踪。该方法利用扩散模型中的交叉注意力机制将文本提示与图像区域对齐,从而无需标注训练数据即可识别和跟踪对象。该系统包括一个初始提示学习器来捕获第一帧中的目标,以及一个在线提示更新器,根据运动信息进行跟踪,并在六个具有挑战性的数据集上证明了其有效性。
-
SeqLoRA通过双层优化推进多概念图像生成
研究人员开发了SeqLoRA,一种用于文本到图像扩散模型参数高效微调的新型框架。该方法通过采用双层优化联合训练LoRA因子来解决组合多个自定义概念的挑战,从而最大限度地减少表示干扰。SeqLoRA在生成多达101个概念的图像方面,展示了改进的身份保持能力和可扩展性,优于现有的模块化方法。
-
新的Hydra框架稳定了扩散模型中的多概念后门攻击
研究人员开发了Hydra,一个旨在稳定文本到图像扩散模型中多概念后门注入的框架。这一点至关重要,因为开源模型经常被微调和重新分发,导致潜在的冲突和因累积的后门行为而导致的质量下降。Hydra通过演进与目标概念对齐但对其他概念保持稳定的文本编码器触发器来解决这个问题,并使用多任务微调结合正则化来增强训练稳定性。实验表明,Hydra在保持干净生成保真度的同时,实现了高攻击成功率。