研究人员开发了一种新颖的越狱技术,用于对齐大型语言模型,该技术利用了同人小说子类型。该方法使用来自十二个不同Archive of Our Own (AO3) 子类型的段落来嵌入有害行为,绕过传统防御。该攻击将八个LLM的攻击成功率(ASR)从0.278显著提高到0.731,表明其有效性源于写作风格而非提示结构。提出的防御措施被发现无效,这表明需要转向基于语域的攻击。 AI
影响 这项研究突显了LLM安全训练中的新漏洞,可能需要超越简单提示过滤的新型防御机制。
排序理由 该集群包含一篇详细介绍越狱LLM新方法的论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →