研究人员开发了一种名为CollageAttack的新攻击方法,该方法利用了文本到图像(T2I)模型的漏洞。该攻击利用图像中文本片段的空间组合来生成可能在原始提示中不明显的有害语义。实验表明,CollageAttack可以实现高成功率,显著优于现有方法,并通过组合不太明确的元素来产生更有害的输出。 AI
影响 突出了T2I模型中新的跨模态安全差距,可能需要新的防御机制。
排序理由 该集群描述了一篇详细介绍针对T2I模型的新攻击方法的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →