研究人员发现了一类名为约束解码攻击(CDA)的大型语言模型(LLM)新漏洞。该攻击利用了LLM的控制平面,通过利用语法引导的解码过程来注入恶意内容。与传统的数据平面越狱不同,CDA直接作用于解码机制本身,使得内部安全对齐难以阻止。一个具体的实例DictAttack,在GPT-5和Gemini 2.5 Pro等知名模型上实现了94.3%-99.5%的攻击成功率,甚至绕过了最先进的越狱防御。 AI
影响 突显了LLM中一个关键的控制平面漏洞,可能需要超越当前安全对齐的新防御机制。
排序理由 详细介绍LLM新漏洞类别的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Constrained Decoding Attack (CDA)
- DeepSeek-R1
- DictAttack
- EnumAttack
- Gemini 2.5 Pro
- GPT-5
- GPT-OSS 120B
- Shuoming Zhang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →