研究人员发现,像Llama Guard和GPT-4o这样的大型语言模型自动安全判断器,可以通过改变回复的风格或措辞而无需更改其内容,从而被轻易操纵。通过添加内容不变的包装器,如教育性免责声明或虚假推理块,他们能够翻转这些判断器的安全判决。例如,一个令牌拒绝包装器导致GPT-4o-mini将近20%的不安全回复错误地归类为安全,而Llama Guard 4则被“教育课程”的框架确定性地欺骗。这些发现突显了当前大型语言模型安全评估方法存在的重大漏洞,表明这些可被利用的盲点源于被评估模型本身的安全判断器,而非模型本身。 AI
影响 揭示了大型语言模型安全评估中的关键缺陷,可能影响对人工智能系统的信任和部署。
排序理由 研究论文,详细介绍了大型语言模型安全评估方法的漏洞。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Claude
- GPT-4o
- GPT-4o mini
- gpt-oss-safeguard-20b
- JailbreakBench
- Llama Guard
- Llama Guard 4
- StrongREJECT
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →