研究人员发现,大型语言模型的自动安全评判器很容易被操纵,只需改变回应的语气或框架,而不改变其内容。通过添加“内容不变的风格包装器”,例如免责声明或虚假推理块,研究发现包括GPT-4o mini和Llama Guard 4在内的特定评判器,以显著的比例将有害内容错误地归类为安全。这种漏洞存在于评判器本身,而非底层模型,表明当前的安全性评估方法可能并不可靠。 AI
影响 凸显了当前大型语言模型安全评估的潜在不可靠性,需要新的方法来评估内容的真实安全性。
排序理由 学术论文,详细介绍了大型语言模型安全评估方法中一种新颖的漏洞。
在 Hugging Face Daily Papers 阅读 →
- Claude
- GPT-4o
- GPT-4o mini
- gpt-oss-safeguard-20b
- JailbreakBench
- Llama-Guard
- Llama Guard 4
- StrongREJECT
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →