研究人员推出 StepJack,这是一个旨在测试计算机使用代理 (CUA) 在多步间接提示注入攻击下的安全性新基准。这些攻击涉及将对抗性指令分布在一系列网页中,使其单独看起来无害。在包含 480 个测试示例的 StepJack 基准测试中进行的评估显示,多步攻击将包括 GPT-5.4 Mini 在内的几款最先进的 CUA 的成功率显著提高了 31.2 个百分点。 AI
影响 这项研究揭示了 AI 代理的一个新漏洞,可能需要开发人员针对复杂的提示注入技术实施更强大的安全措施。
排序理由 该集群描述了一篇介绍 AI 安全研究新基准和攻击类别的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Computer Use Agents
- EvoCUA-32B
- GPT 5.4 Mini
- indirect prompt injection
- multi-step indirect prompt injection
- StepJack
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →