MLCommons 发布了越狱基准测试 v1.0,这是一种评估大型语言模型 (LLM) 在对抗性提示(旨在绕过安全防护措施)方面的鲁棒性的新方法。该基准测试使用 264 个种子提示,涵盖十一个危险类别,评估了八个开源模型。结果显示,在越狱条件下,不安全响应率从基线条件的 11.08% 上升到 18.65%,平均“韧性差距”为 7.57%。该基准测试旨在为可复现的越狱评估和未来研究提供基础。 AI
影响 为评估 LLM 免受对抗性攻击的安全性建立了一种标准化方法,有望推动模型鲁棒性的改进。
排序理由 发布了评估 LLM 安全性的新基准测试和方法。 [lever_c_demoted from research: ic=1 ai=1.0]
- AILuminate Assessment Standard v1.4
- arXiv
- Hugging Face
- large-language models
- MLCommons
- MLCommons Jailbreak Benchmark v1.0
- MLCommons Jailbreak Taxonomy
- Resilience Gap
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →