PulseAugur
实时 13:27:46
English(EN) AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

新的AEGIS防御机制应对文本到图像模型中的视觉同义词攻击 · 跟踪3个来源

研究人员开发了AEGIS,这是一种新颖的防御机制,旨在对抗文本到图像扩散模型中的视觉同义词攻击(VSA)。与以往专注于明确不安全概念的方法不同,AEGIS动态追踪禁止的语义在生成过程中如何出现。通过识别充当不安全视觉语义瓶颈的特定注意力头,AEGIS应用有针对性的排斥来提高安全性和可用性,而不会压制良性概念。该系统已在SD 1.4和SD 2.1等模型上证明了有效性,显著降低了攻击成功率。 AI

影响 增强了文本到图像模型的安全性,可能减少滥用并提高用户信任度。

排序理由 该集群包含一篇详细介绍AI安全新技术的学术论文。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

新的AEGIS防御机制应对文本到图像模型中的视觉同义词攻击 · 跟踪3个来源

报道来源 [3]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    AEGIS:一种机制引导的防御方法,用于应对文本到图像模型中的视觉同义词越狱攻击

    Text-to-image diffusion models have achieved high visual fidelity and broad adoption, but remain vulnerable to safety violations when adversaries exploit them to synthesize illicit content. Existing alignment paradigms, from input sanitization to structural feature pruning, are l…

  2. arXiv cs.CV TIER_1 English(EN) · Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang ·

    AEGIS:一种机制引导的防御方法,用于应对文本到图像模型中的视觉同义词越狱攻击

    arXiv:2607.06120v1 Announce Type: new Abstract: Text-to-image diffusion models have achieved high visual fidelity and broad adoption, but remain vulnerable to safety violations when adversaries exploit them to synthesize illicit content. Existing alignment paradigms, from input s…

  3. arXiv cs.CV TIER_1 English(EN) · Min Yang ·

    AEGIS:一种机制引导的防御方法,用于应对文本到图像模型中的视觉同义词越狱攻击

    Text-to-image diffusion models have achieved high visual fidelity and broad adoption, but remain vulnerable to safety violations when adversaries exploit them to synthesize illicit content. Existing alignment paradigms, from input sanitization to structural feature pruning, are l…