PulseAugur
实时 09:51:06
English(EN) The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models

新攻击与防御利用未学习扩散模型中的残余概念

研究人员在扩散模型的令牌嵌入空间中发现了一个持久的线性子空间,即使在尝试遗忘后仍保留有害概念。这一发现促使开发了SubAttack,一种利用该子空间并通过组合可解释文本元素的新型越狱方法。为应对此,研究人员还提出了SubDefense,一种轻量级防御机制,通过投影出残余概念来增强鲁棒性并保持生成质量。 AI

影响 为生成式AI的模型漏洞和防御机制提供了新见解。

排序理由 学术论文,详细介绍了攻击和防御AI模型的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新攻击与防御利用未学习扩散模型中的残余概念

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Siyi Chen, Yimeng Zhang, Sijia Liu, Qing Qu ·

    可解释令牌的线性几何:未学习扩散模型的越狱攻击与防御

    arXiv:2504.21307v3 Announce Type: replace Abstract: Diffusion models excel at generating high-quality images but can memorize and reproduce harmful concepts when prompted. Although fine-tuning methods have been proposed to unlearn a target concept, they struggle to fully erase it…