PulseAugur
实时 10:19:03
English(EN) Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs

新的“Latent Fusion Jailbreak”以94%的成功率绕过LLM安全措施

研究人员开发了一种名为Latent Fusion Jailbreak (LFJ) 的新型白盒攻击方法,可以绕过大型语言模型的安全措施。LFJ通过将有害查询与相似但无害的查询相结合,然后在特定层和token位置对它们的内部表征进行插值来实现。该技术在五个开源模型和四个安全基准测试中实现了94.13%的攻击成功率。还引入了一种潜在的对抗性训练程序,当攻击针对防御模型重新优化时,攻击成功率降低到12.37%。 AI

影响 这项研究突显了当前LLM安全对齐的一个重大漏洞,可能需要新的防御策略。

排序理由 研究论文,详细介绍了一种新的LLM越狱方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的“Latent Fusion Jailbreak”以94%的成功率绕过LLM安全措施

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Wenpeng Xing, Bohan Yang, Mohan Li, Chunqiang Hu, Haitao Xu, Ningyu Zhang, Bo Lin, Meng Han ·

    Latent Fusion Jailbreak:融合有害和无害表征以诱导不安全 LLM 输出

    arXiv:2508.10029v3 Announce Type: replace-cross Abstract: Safety-aligned large language models can still be manipulated through white-box interventions that modify their internal representations. We introduce Latent Fusion Jailbreak (LFJ), which works by pairing a harmful query w…