PulseAugur
实时 09:23:17
English(EN) When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

新的LLM漏洞'CDA'绕过了GPT-5、Gemini的安全防护

研究人员发现了一类名为约束解码攻击(CDA)的大型语言模型(LLM)新漏洞。该攻击利用了LLM的控制平面,通过利用语法引导的解码过程来注入恶意内容。与传统的数据平面越狱不同,CDA直接作用于解码机制本身,使得内部安全对齐难以阻止。一个具体的实例DictAttack,在GPT-5和Gemini 2.5 Pro等知名模型上实现了94.3%-99.5%的攻击成功率,甚至绕过了最先进的越狱防御。 AI

影响 突显了LLM中一个关键的控制平面漏洞,可能需要超越当前安全对齐的新防御机制。

排序理由 详细介绍LLM新漏洞类别的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的LLM漏洞'CDA'绕过了GPT-5、Gemini的安全防护

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui ·

    当语法指导攻击:利用结构化输出来揭示LLM中的控制平面漏洞

    arXiv:2503.24191v4 Announce Type: replace-cross Abstract: Content Warning: This paper may contain unsafe or harmful content generated by LLMs that may be offensive to readers. Large Language Models (LLMs) increasingly serve as tooling platforms through structured output APIs, but…