AgentDojo
PulseAugur coverage of AgentDojo — every cluster mentioning AgentDojo across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Qwen 3.8 27B 模型在 AgentDojo 测试中易受提示注入攻击
最近在 AgentDojo 框架内对 Qwen 3.8 27B 模型进行的测试揭示了其在提示注入攻击面前的漏洞。大约 11.7% 的此类攻击导致了未经授权的操作,这凸显了本地代理在区分数据和命令方面的结构性弱点。
-
StepGuard系统通过步进式控制增强AI代理安全性
研究人员开发了StepGuard,一个新颖的系统,旨在逐个步骤地监控和控制AI代理的行为,而不仅仅是评估已完成的轨迹。这种方法旨在防止未经授权的文件修改或数据泄露等安全风险。StepGuard利用一个名为StepGen的数据引擎来创建安全和不安全的操作示例,并使用一个名为Balance-GRPO的平衡算法来微调模型区分安全和不安全操作的准确性。在测试中,StepGuard显著降低了代理平台上的攻击成功率,同时仅对整体效用产生微小影响,…
-
新的防御探针可检测并缓解LLM中的间接提示注入
研究人员开发了一种方法来检测Agentic大型语言模型(LLM)中的间接提示注入(IPI)攻击。通过在模型的内部状态上训练简单的线性探针,他们可以预测IPI暴露,在包括GLM-5.2在内的各种模型上准确率超过90%。该研究还发现LLM编码IPI信号的能力与其安全响应这些信号的能力之间存在差距。为了解决这个问题,引入了一种名为AGRI的防御机制,它使用探针门控推理来显著降低攻击成功率,同时保留正常的任务效用。
-
新的PIMiner系统可自动进行LLM提示注入红队测试
研究人员开发了PIMiner,一个用于大型语言模型自动提示注入红队测试的代理系统。与现有方法常常难以泛化不同,PIMiner在训练过程中从头开始构建了一个可转移的策略库。该库可以以最少的查询应用于新的、未见的模型。实验表明,PIMiner在IPIArena和AgentDojo等基准测试中,对Gemini 2.5 Pro、GPT-5.1和Claude Sonnet 4.5等模型取得了显著的攻击成功率。
-
新的提示注入检测技术利用跨领域方法
研究人员开发了七种新颖的提示注入攻击检测技术,超越了传统的模式匹配和微调Transformer分类器。这些新方法借鉴了法医语言学、生物信息学和欺骗技术等不同领域的灵感。prompt-shield v0.4.1版本整合了其中三种技术,在多个数据集上显著提高了检测率,尤其是在间接注入攻击方面,同时保持了较低的误报率。
-
新方法通过对工具调用中的风险进行分层来增强LLM代理的安全性
研究人员开发了一种名为角色分层每字段共识风险控制的新方法,以增强语言模型代理的安全性。该技术分别校准工具调用中不同语义角色的风险预算,防止高风险的失败被良性参数所掩盖。该方法在AgentDojo和InjecAgent上使用多种语言模型进行了测试,即使在各种迁移和自适应攻击场景下,也始终能满足特定角色的风险预算。
-
新的RL框架PISmith测试并攻破提示注入防御
研究人员开发了PISmith,一个新颖的强化学习(RL)框架,旨在严格测试大型语言模型(LLMs)中提示注入防御的有效性。该框架训练一个攻击LLM,通过在黑盒设置中优化注入的提示来发现漏洞,在黑盒设置中只能观察到LLM的输出。PISmith结合了自适应熵正则化和动态优势加权,以克服奖励稀疏性等挑战,从而能够从罕见的成功攻击中进行更有效的学习。在13个基准和代理设置上的评估表明,PISmith能够成功突破最先进的防御,其性能优于现有的攻…
-
新方法压缩大语言模型代理上下文,以提高安全性和效率
研究人员开发了新的方法来压缩大语言模型(LLM)代理的上下文,以提高效率和安全性。一种方法是“Twin Agent”,它将代理分为用于处理不受信任信息的“Explore Agent”和用于执行特权操作的“Safe Agent”,并使用紧凑的提示来维持效用同时防止攻击。另一种方法是“Distil”,它使用统计上的非劣性检验来确保上下文压缩不会改变代理的决策过程,在SWE-bench任务上实现了与完整上下文相当的性能。
-
新管道使代理式AI应用程序免受数据泄露的侵害
研究人员开发了一种新的部署前管道,旨在防止代理式应用程序中的数据泄露和工具滥用。该管道通过分析提示模板、工具接口和代码来扫描、加固和验证代理式系统,以识别和修补漏洞。该系统优先处理高风险工具,并应用最小侵入性缓解措施,如模式收紧和基于允许列表的工具门控。通过对抗性提示注入攻击和良性输入变体进行验证,以确保功能得以保留。在对五个真实世界的代理式应用程序和AgentDojo基准进行的评估中,该管道成功识别了泄露模式,并生成了补丁,在基本攻…
-
新基准测试表明,提示优化可能会削弱大型语言模型的对抗性鲁棒性
开发了一个新的基准测试,以研究大型语言模型(LLMs)的提示优化技术是否会削弱它们对抗恶意攻击(特别是提示注入)的鲁棒性。初步研究结果表明,虽然提示优化可以提高在干净数据集上的准确性,但可能会导致对抗提示注入攻击的安全性下降。该基准测试旨在弥合提示优化和提示注入研究社区之间的差距,这两个社区历史上一直独立运作。
-
LLM攻击基准覆盖率不到威胁全景的25%
研究人员开发了一个新的框架来审计旨在测试大型语言模型(LLM)攻击的基准的覆盖范围。该框架基于对500多种推理时攻击的分类法,显示当前领先的基准覆盖的潜在威胁全景不到25%。值得注意的是,服务中断和模型内部等类别缺乏标准化评估,尽管在这些领域已有记录在案的成功攻击。
-
New Protocol Enables LLMs to Safely Control Small Devices
研究人员推出了一种名为设备上下文协议(DCP)的新架构,旨在使大型语言模型(LLM)能够安全地控制受限设备。DCP比现有的MCP等协议更轻量级,典型帧大小小于50字节,适用于微控制器。它在协议层集成了安全功能,如能力范围限定和范围检查,以防止LLM发出有害命令。一项实证研究表明,在多个LLM和对抗性提示下,DCP成功拒绝了100%的能力升级尝试和78%的提示注入尝试。
-
Arc Gate 为 OpenAI 的“无法修复”的提示注入漏洞提供解决方案
OpenAI 已表示,浏览器代理中的提示注入是模型层面的、无法修复的结构性漏洞。然而,一种名为 Arc Gate 的新架构解决方案已在缓解这些攻击方面取得了显著成功。据报道,Arc Gate 在 AgentDojo 基准测试中达到了 100% 的有效性,在 InjecAgent 中达到了 99%,独立验证显示与未受保护的相同模型相比,成功率为 25/25。
-
LLM攻击基准显示安全覆盖存在显著差距
研究人员开发了一个新的框架来审计LLM攻击基准的覆盖范围,揭示了当前评估中存在的显著差距。他们对六个公开基准的分析显示,这些基准总共覆盖了不到25%已识别的威胁面,而服务中断和模型内部等整个类别缺乏标准化测试。该研究还强调了攻击命名广泛碎片化的问题,许多不同的术语用于同一种攻击类型,并且研究高度集中在安全与对齐绕过方面。
-
新攻击利用LLM代理中继,绕过对齐防御
研究人员发现了一种在采用自带密钥(BYOK)系统的LLM代理架构中的新漏洞。这些架构通过第三方中继路由LLM流量,造成了一个完整性缺口,恶意中继可以在对齐后、代理执行前篡改LLM响应。这种“中继篡改攻击”(RTA)可以成功修改消息,使即使是对齐的LLM也失效,在各种LLM和代理环境中,攻击成功率高达99.1%。
-
新的基准和安全方法出现,用于先进的大模型代理
新研究探讨了AI代理的开发和评估,重点关注它们在复杂环境中导航和遵守策略的能力。StarDojo在《星露谷物语》等开放式模拟中对代理性能进行基准测试,揭示了视觉理解和推理方面的局限性。CostBench在动态旅行规划场景中评估大模型代理的成本最优规划和适应能力,显示出经济推理方面的显著差距。其他论文介绍了使用基于自我报告的具身大模型代理进行个体模拟的方法,开发用于高效多代理推理的符号通信,以及解决由长时域代理中的上下文压缩引起的“治理…