两篇新的研究论文介绍了用于评估大型语言模型 (LLM) 代理安全性的基准测试,特别关注它们对提示注入和操纵的易感性。第一篇论文《可信凭证,不可信行为》解决了高性能计算 (HPC) 环境中的独特挑战,在这些环境中,代理在用户凭证下运行,并且尽管有授权命令,仍可能被重定向到恶意操作。第二篇论文《自适应对手》提出了一个多轮基准测试,模拟了从防御者响应中学习的自适应攻击者,揭示了当前 LLM 代理(如 Claude Opus 4.6、GPT-5.4 和 Gemini)的重大漏洞。 AI
影响 这些基准测试突显了 LLM 代理的关键安全漏洞,可能影响其在高性能计算等敏感环境中的安全部署。
排序理由 两篇学术论文介绍了 LLM 代理安全的新基准测试。
- Adaptive adversaries
- arXiv
- Claude Opus 4.6
- Gemini
- GPT-5.4
- GPT OSS 20B
- high-performance computing
- LLM agents
- prompt injection
- TaskBound
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →