研究人员开发了一种针对大语言模型(LLM)的新型后门攻击,该攻击作用于回答侧而非输入侧。这种新颖的方法涉及一个良性的初始提示,导致LLM生成一个特定词语,该词语随后嵌入对话历史中作为触发器。当后续出现有害查询时,模型会识别出自身生成的触发器并绕过安全协议,即使用户的输入是干净的。这种回答侧后门攻击在低中毒率下实现了对多个LLM近乎完美的攻击成功率,规避了当前以输入为中心的防御措施,并凸显了LLM安全对齐方面的一个重大漏洞。 AI
影响 凸显了当前LLM安全对齐方面的一个关键盲点,可能需要新的防御策略。
排序理由 详细介绍针对LLM的新型攻击向量的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- answer-side backdoor
- arXiv
- Attack Success Rates
- dialogue history
- harmful query
- input-centric defenses
- large-language models
- LLM defenses
- Multi-turn dialogue response generation via mutual information maximization
- poisoning rate
- Representation-level analysis
- User input interfaces
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →