研究人员开发了一个新的基准来评估 LLM 代理的滥用监控能力,特别关注分解和提示注入攻击。该基准包含约 6,200 份对话记录,引入了一种用于跟踪级别监控的统一形式。它评估监控器在多大程度上能够识别代理响应变得有害的确切点,而不仅仅是将整个轨迹分类为有害。面向动作的监控器在两种攻击类型上都表现出色,而面向内容的监控器在提示注入攻击方面则遇到困难。 AI
影响 该基准有望促使 LLM 代理更加健壮,能够抵御复杂的滥用策略。
排序理由 学术论文,提出 LLM 安全研究的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
- action-framed monitors
- arXiv
- content-framed monitors
- decomposition attacks
- LLM agents
- prompt injection attacks
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →