PulseAugur
实时 15:37:57

新基准揭示LLM代理易受自适应多轮攻击

研究人员开发了一个名为Adaptive Adversaries的新基准,用于测试LLM代理在多轮自适应攻击下的安全性。该基准揭示了显著的漏洞,攻击成功率从单轮场景的0-1%上升到多轮自适应攻击的5.4-14.0%。当使用三个前沿LLM作为攻击者时,成功率比单个攻击者高1.4-2.2倍,并且生成的攻击与现有基准的相似度较低。Claude Opus 4.6和GPT-5.4总体表现相似,但在特定场景下表现出不同的弱点。 AI

影响 凸显了LLM代理关键的安全漏洞,亟需改进防御措施以应对复杂的、多轮的攻击。

排序理由 该项目是一篇研究论文,介绍了一个用于LLM代理安全性的新基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示LLM代理易受自适应多轮攻击

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Devina Jain, David Hartmann, Chuan Li ·

    自适应对手:一个用于 LLM Agent 安全的多轮、多 LLM 基准测试

    arXiv:2607.18063v1 Announce Type: cross Abstract: LLM-based agents process external content, exposing them to prompt injection and multi-turn manipulation. Most safety benchmarks evaluate defenders against fixed attack pools collected before evaluation, single-turn or multi-turn.…