研究人员开发了一种名为Latent Fusion Jailbreak (LFJ) 的新型白盒攻击方法,可以绕过大型语言模型的安全措施。LFJ通过将有害查询与相似但无害的查询相结合,然后在特定层和token位置对它们的内部表征进行插值来实现。该技术在五个开源模型和四个安全基准测试中实现了94.13%的攻击成功率。还引入了一种潜在的对抗性训练程序,当攻击针对防御模型重新优化时,攻击成功率降低到12.37%。 AI
影响 这项研究突显了当前LLM安全对齐的一个重大漏洞,可能需要新的防御策略。
排序理由 研究论文,详细介绍了一种新的LLM越狱方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Latent Fusion Jailbreak
- ScienceCast
- Wenpeng Xing
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →