一项新的评估表明,GPT-6 Astra 可成功抵御 99.99% 的直接提示注入攻击。然而,在涉及通过文档进行的间接攻击的案例中,它会在 8.5% 的情况下失败。Claude Opus 5 在这些间接攻击方面表现更好,仅在 4.8% 的情况下失败。 AI
影响 凸显了大型语言模型持续存在的安全挑战,特别是关于通过文档进行的间接攻击,这可能会影响自主代理的开发。
排序理由 该集群报告了对 AI 模型在提示注入攻击方面的安全评估。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →