PulseAugur
实时 08:17:12

新基准测试 AI 代理在多步提示注入攻击下的安全性

研究人员推出 StepJack,这是一个旨在测试计算机使用代理 (CUA) 在多步间接提示注入攻击下的安全性新基准。这些攻击涉及将对抗性指令分布在一系列网页中,使其单独看起来无害。在包含 480 个测试示例的 StepJack 基准测试中进行的评估显示,多步攻击将包括 GPT-5.4 Mini 在内的几款最先进的 CUA 的成功率显著提高了 31.2 个百分点。 AI

影响 这项研究揭示了 AI 代理的一个新漏洞,可能需要开发人员针对复杂的提示注入技术实施更强大的安全措施。

排序理由 该集群描述了一篇介绍 AI 安全研究新基准和攻击类别的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准测试 AI 代理在多步提示注入攻击下的安全性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zhuoxin Zhan, Akbar Rafiey, Avery Ma, Leila Pishdad, Layla El Asri ·

    StepJack:针对多步间接提示注入的计算机使用代理安全基准测试

    arXiv:2608.06477v1 Announce Type: cross Abstract: Computer-use agents (CUAs) face a growing threat from indirect prompt injection, where adversarial instructions are planted in the environment such as web pages. In this paper, we introduce multi-step indirect prompt injection, a …