研究人员开发了一种针对大型语言模型(LLM)越狱攻击的新型防御机制。该自演化框架使用持久化规则内存,能够实时适应新的攻击策略,而无需更新模型参数。当攻击成功时,系统会将攻击的结构性包装抽象成一个通用规则,并将其应用于未来的输入。该方法已证明在各种模型和攻击家族中显著降低了攻击成功率,同时保持了效用并避免了过度拒绝率的增加。 AI
影响 这种防御机制可以显著提高LLM在对抗性操纵下的安全性和可靠性。
排序理由 该集群包含一篇详细介绍LLM安全新技术方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large language models
- LLM jailbreak attacks
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →