实体
SANDBOXESCAPEBENCH
SANDBOXESCAPEBENCH
PulseAugur coverage of SANDBOXESCAPEBENCH — every cluster mentioning SANDBOXESCAPEBENCH across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
LLM Agent 安全:工具模式利用的风险超过容器逃逸
最近的一项分析强调了 LLM Agent 部署中两种不同的安全漏洞:容器逃逸和工具模式层利用。虽然容器加固可以解决前者,但后者涉及 Agent 和工具之间的通信协议,目前仍很大程度上未被监控,也缺乏专门的 CVE 分类。当前 LLM 模型比利用新颖内核漏洞更擅长利用常见的容器配置错误,这一事实加剧了这一差距。SandboxEscapeBench 测试表明,Claude Opus 4.5 通过配置错误实现了 49% 的逃逸率,但内核利用…
-
新基准量化大语言模型沙箱逃逸能力
研究人员开发了SANDBOXESCAPEBENCH,一个旨在安全评估大语言模型(LLMs)突破容器化沙箱环境能力的新基准。该基准以夺旗赛(CTF)挑战的形式实现,模拟了一个在容器内拥有shell访问权限的对抗性代理,并涵盖了各种逃逸机制,包括配置错误、权限错误和内核漏洞。初步研究结果表明,大语言模型能够成功识别并利用这些沙箱内的漏洞,突显了此类评估方法对于确保先进AI代理隔离环境的持续安全性的必要性。