研究人员开发了一个名为Adaptive Adversaries的新基准,用于测试LLM代理在多轮自适应攻击下的安全性。该基准揭示了显著的漏洞,攻击成功率从单轮场景的0-1%上升到多轮自适应攻击的5.4-14.0%。当使用三个前沿LLM作为攻击者时,成功率比单个攻击者高1.4-2.2倍,并且生成的攻击与现有基准的相似度较低。Claude Opus 4.6和GPT-5.4总体表现相似,但在特定场景下表现出不同的弱点。 AI
影响 凸显了LLM代理关键的安全漏洞,亟需改进防御措施以应对复杂的、多轮的攻击。
排序理由 该项目是一篇研究论文,介绍了一个用于LLM代理安全性的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →