两篇新研究论文探讨了 AI 代理的安全漏洞,特别是那些对系统和工具有持久访问权限的代理。第一篇论文《从计算机系统视角理解和评估类似爪的代理安全》介绍了 SafeClawArena,这是一个用于测试四个攻击面上的对抗性任务的基准。研究发现恶意插件的成功率为 100%,并且虽然 SeClaw 等一些代理降低了 GPT-5.4 和 Claude Opus-4.6 等模型的攻击成功率,但 Claude Opus-4.6 在各个平台上始终保持较低的成功率。第二篇论文《从工具连接到执行控制:基准测试 MCP 式代理运行时的安全不变性》提出了 HCP,这是一个实现了八个安全不变性来控制代理执行的参考运行时。与安全性较低的基线不同,HCP 在基准测试案例中成功阻止了所有测试攻击,这表明代理系统需要一个执行控制层。 AI
影响 强调了当前 AI 代理中的重大安全漏洞,并提出了新的框架来降低风险,可能影响未来的代理开发。
排序理由 两篇学术论文发表在 arXiv 上,详细介绍了 AI 代理的新安全基准和控制机制。
- Handle-Capability Protocol
- MCP
- Model Context Protocol
- arXiv
- Claude Opus-4.6
- GPT-5.4
- Hugging Face
- NemoClaw
- OpenClaw
- SafeClawArena
- SeClaw
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →