研究人员开发了一种名为STEER(Safety Targeted Embedding Exploit via Refinement,通过精炼实现安全目标嵌入式漏洞利用)的新方法,以利用大型语言模型(LLM)安全训练中的漏洞。该技术针对主要以英语训练的模型,表明其安全机制对低资源语言和混合语言输入的泛化能力不佳。STEER在各种基准测试中实现了很高的攻击成功率,甚至可以迁移到GPT-4o-mini等模型,凸显了当前多语言安全对齐方面的重大差距。 AI
影响 强调了改进LLM多语言安全对齐的必要性,以防止漏洞被利用。
排序理由 该集群包含一篇详细介绍针对LLM安全机制的新攻击方法的论文。
- AdvBench
- arXiv
- GPT-4o-mini
- Greedy Coordinate Gradient
- Hugging Face
- JailbreakBench
- Joshua Adrian Cahyono
- STEER
- English
- large language models
- LLMs
- Safety Targeted Embedding Exploit via Refinement
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →