研究人员在扩散模型的令牌嵌入空间中发现了一个持久的线性子空间,即使在尝试遗忘后仍保留有害概念。这一发现促使开发了SubAttack,一种利用该子空间并通过组合可解释文本元素的新型越狱方法。为应对此,研究人员还提出了SubDefense,一种轻量级防御机制,通过投影出残余概念来增强鲁棒性并保持生成质量。 AI
影响 为生成式AI的模型漏洞和防御机制提供了新见解。
排序理由 学术论文,详细介绍了攻击和防御AI模型的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →