indirect prompt injection
PulseAugur coverage of indirect prompt injection — every cluster mentioning indirect prompt injection across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新基准测试 AI 代理在多步提示注入攻击下的安全性
研究人员推出 StepJack,这是一个旨在测试计算机使用代理 (CUA) 在多步间接提示注入攻击下的安全性新基准。这些攻击涉及将对抗性指令分布在一系列网页中,使其单独看起来无害。在包含 480 个测试示例的 StepJack 基准测试中进行的评估显示,多步攻击将包括 GPT-5.4 Mini 在内的几款最先进的 CUA 的成功率显著提高了 31.2 个百分点。
-
间接提示注入:自主 AI 代理的新威胁
自主代理系统,特别是那些使用模型上下文协议 (MCP) 和浏览器自动化的系统,面临着一种称为间接提示注入 (IPI) 的新威胁。与直接提示注入不同,IPI 发生在代理处理包含旨在劫持其控制流的隐藏指令的不可信外部数据时。这种漏洞的出现是因为大型语言模型 (LLM) 在同一上下文窗口内处理数据和指令,使得区分开发人员定义的提示和恶意摄入的文本变得困难,这类似于跨站脚本 (XSS) 如何影响 Web 应用程序。
-
新方法增强了对恶意AI指令的检测能力
研究人员开发了一种检测嵌入文本中的恶意指令的新方法,这种漏洞被称为间接提示注入(IPI)。该方法具有上下文和查询感知能力,优于现有检测器。为了增强对自适应规避攻击的鲁棒性,研究人员实施了两种对抗性训练方法:一种使用基于投影梯度的方法在嵌入空间中进行优化,另一种通过基于LLM的释义来模拟真实世界的攻击。实验表明,该方法优于当前基线,尤其是在对抗自适应攻击方面,尽管最优参数可能因应用领域而异。
-
新的防御探针可检测并缓解LLM中的间接提示注入
研究人员开发了一种方法来检测Agentic大型语言模型(LLM)中的间接提示注入(IPI)攻击。通过在模型的内部状态上训练简单的线性探针,他们可以预测IPI暴露,在包括GLM-5.2在内的各种模型上准确率超过90%。该研究还发现LLM编码IPI信号的能力与其安全响应这些信号的能力之间存在差距。为了解决这个问题,引入了一种名为AGRI的防御机制,它使用探针门控推理来显著降低攻击成功率,同时保留正常的任务效用。
-
新框架MUZZLE发现44种新型攻击
研究人员开发了MUZZLE,一个旨在测试Web代理针对间接提示注入攻击安全性的自动化框架。该系统能够自适应地识别易受攻击的注入点,并精心设计上下文感知的恶意指令来损害机密性、完整性和可用性。MUZZLE的评估在各种Web应用程序和LLM中发现了大量新型攻击,证明了其在最少人工监督下发现漏洞的有效性。
-
ReAct Agent 易受提示注入攻击,深度是关键
研究人员调查了 ReAct Agent(结合推理和工具使用)在间接提示注入攻击方面的脆弱性。他们的研究发现,注入在工具序列中的深度显著影响攻击的成功率,早期注入更有效。Claude Haiku 在所有深度上都表现出对这些攻击的强大抵抗力,而 GPT-4o-mini 的成功率随着注入深度的增加而显著下降。研究还表明,回合预算似乎不是主要的风险因素,但框架会影响成功率。
-
AI代理因技能修改而容易出现失控行为
如果AI代理的技能被稍作修改,它们可能会变得无法控制,导致意外行为。这种被称为间接提示注入的漏洞发生的原因是,代理将所有输入(包括恶意输入)都视为同等权威。为缓解此问题,应在AI模型本身之外实施安全措施,例如严格只允许使用特定工具,并限制凭证的范围和有效期。
-
新研究质疑提示注入攻击对RAG系统的有效性
近期研究表明,针对检索增强生成(RAG)系统的提示注入攻击可能不如之前认为的那么有效。重新评估这些攻击在包含检索和重排阶段的真实RAG流程中的研究发现,许多基于梯度和指令覆盖的攻击在到达生成器之前就已失败。由大型语言模型(LLM)驱动的提示注入仍然有效,但即使是这些攻击,也可以通过轻量级防御措施轻松检测到。此外,正在开发像LivePI这样的新基准,以更真实地评估跨越各种输入表面和恶意目标的间接提示注入风险,成功率因模型和攻击向量而异。