indirect prompt injection
PulseAugur coverage of indirect prompt injection — every cluster mentioning indirect prompt injection across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的多智能体AI安全协议可对抗隐藏的提示注入攻击
研究人员正在开发新的方法来保护多智能体AI系统免受间接提示注入攻击,在这种攻击中,恶意指令隐藏在智能体处理的数据中。一种名为 multi-CaMeL 的新协议旨在跨智能体交互保留数据来源,与现有方法相比,显著降低了此类攻击的成功率。这项研究强调了保护AI智能体所面临的更广泛的挑战,并强调需要强大的安全架构,这些架构假设内容会被泄露,并侧重于限制此类泄露的后果,而不是仅仅依赖提示过滤。
-
AI代理易受MCP工作流间接提示注入攻击
本教程详细介绍了如何在模型上下文协议(MCP)服务器工作流中审计和利用间接提示注入。这种漏洞,也称为跨域提示注入(XPIA),当AI代理处理包含隐藏指令的不可信外部数据时产生。与直接提示注入不同,这些攻击通过在MCP工具(如网页或文件)获取的内容中嵌入恶意命令来劫持代理的控制流。教程概述了技术基础,包括MCP会话中使用的JSON-RPC 2.0执行循环,以演示LLM解析器如何误解这些外部数据为系统指令。
-
新框架应对 AI 代理的自适应提示注入攻击
研究人员开发了 CoRL,一个用于防御和模拟工具增强语言代理的自适应间接提示注入 (IPI) 攻击的新框架。IPI 攻击将对抗性指令隐藏在工具输出中,对代理执行构成重大威胁。CoRL 通过将自适应 IPI 建模为马尔可夫博弈来解决此问题,使攻击者能够发展其策略,防御者能够调整其防御。该框架包括攻击初始化、协同进化训练和防御者巩固阶段,在保持任务效用的同时显著降低了攻击成功率。
-
新基准测试 AI 代理在多步提示注入攻击下的安全性
研究人员推出 StepJack,这是一个旨在测试计算机使用代理 (CUA) 在多步间接提示注入攻击下的安全性新基准。这些攻击涉及将对抗性指令分布在一系列网页中,使其单独看起来无害。在包含 480 个测试示例的 StepJack 基准测试中进行的评估显示,多步攻击将包括 GPT-5.4 Mini 在内的几款最先进的 CUA 的成功率显著提高了 31.2 个百分点。
-
间接提示注入:自主 AI 代理的新威胁
自主代理系统,特别是那些使用模型上下文协议 (MCP) 和浏览器自动化的系统,面临着一种称为间接提示注入 (IPI) 的新威胁。与直接提示注入不同,IPI 发生在代理处理包含旨在劫持其控制流的隐藏指令的不可信外部数据时。这种漏洞的出现是因为大型语言模型 (LLM) 在同一上下文窗口内处理数据和指令,使得区分开发人员定义的提示和恶意摄入的文本变得困难,这类似于跨站脚本 (XSS) 如何影响 Web 应用程序。
-
新方法增强了对恶意AI指令的检测能力
研究人员开发了一种检测嵌入文本中的恶意指令的新方法,这种漏洞被称为间接提示注入(IPI)。该方法具有上下文和查询感知能力,优于现有检测器。为了增强对自适应规避攻击的鲁棒性,研究人员实施了两种对抗性训练方法:一种使用基于投影梯度的方法在嵌入空间中进行优化,另一种通过基于LLM的释义来模拟真实世界的攻击。实验表明,该方法优于当前基线,尤其是在对抗自适应攻击方面,尽管最优参数可能因应用领域而异。
-
新的防御探针可检测并缓解LLM中的间接提示注入
研究人员开发了一种方法来检测Agentic大型语言模型(LLM)中的间接提示注入(IPI)攻击。通过在模型的内部状态上训练简单的线性探针,他们可以预测IPI暴露,在包括GLM-5.2在内的各种模型上准确率超过90%。该研究还发现LLM编码IPI信号的能力与其安全响应这些信号的能力之间存在差距。为了解决这个问题,引入了一种名为AGRI的防御机制,它使用探针门控推理来显著降低攻击成功率,同时保留正常的任务效用。
-
新框架MUZZLE发现44种新型攻击
研究人员开发了MUZZLE,一个旨在测试Web代理针对间接提示注入攻击安全性的自动化框架。该系统能够自适应地识别易受攻击的注入点,并精心设计上下文感知的恶意指令来损害机密性、完整性和可用性。MUZZLE的评估在各种Web应用程序和LLM中发现了大量新型攻击,证明了其在最少人工监督下发现漏洞的有效性。
-
ReAct Agent 易受提示注入攻击,深度是关键
研究人员调查了 ReAct Agent(结合推理和工具使用)在间接提示注入攻击方面的脆弱性。他们的研究发现,注入在工具序列中的深度显著影响攻击的成功率,早期注入更有效。Claude Haiku 在所有深度上都表现出对这些攻击的强大抵抗力,而 GPT-4o-mini 的成功率随着注入深度的增加而显著下降。研究还表明,回合预算似乎不是主要的风险因素,但框架会影响成功率。
-
AI代理因技能修改而容易出现失控行为
如果AI代理的技能被稍作修改,它们可能会变得无法控制,导致意外行为。这种被称为间接提示注入的漏洞发生的原因是,代理将所有输入(包括恶意输入)都视为同等权威。为缓解此问题,应在AI模型本身之外实施安全措施,例如严格只允许使用特定工具,并限制凭证的范围和有效期。
-
新研究质疑提示注入攻击对RAG系统的有效性
近期研究表明,针对检索增强生成(RAG)系统的提示注入攻击可能不如之前认为的那么有效。重新评估这些攻击在包含检索和重排阶段的真实RAG流程中的研究发现,许多基于梯度和指令覆盖的攻击在到达生成器之前就已失败。由大型语言模型(LLM)驱动的提示注入仍然有效,但即使是这些攻击,也可以通过轻量级防御措施轻松检测到。此外,正在开发像LivePI这样的新基准,以更真实地评估跨越各种输入表面和恶意目标的间接提示注入风险,成功率因模型和攻击向量而异。