研究人员开发了AEGIS,这是一种新颖的防御机制,旨在对抗文本到图像扩散模型中的视觉同义词攻击(VSA)。与以往专注于明确不安全概念的方法不同,AEGIS动态追踪禁止的语义在生成过程中如何出现。通过识别充当不安全视觉语义瓶颈的特定注意力头,AEGIS应用有针对性的排斥来提高安全性和可用性,而不会压制良性概念。该系统已在SD 1.4和SD 2.1等模型上证明了有效性,显著降低了攻击成功率。 AI
影响 增强了文本到图像模型的安全性,可能减少滥用并提高用户信任度。
排序理由 该集群包含一篇详细介绍AI安全新技术的学术论文。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →