发布了一个包含对抗性提示注入字符串的新数据集,这些字符串专门用于测试大型语言模型 (LLM) 护栏的安全性和鲁棒性。该数据集对各种攻击方法进行了分类,包括角色扮演、混淆、数据泄露和拒绝覆盖,为安全专业人员提供了一套全面的测试用例。 AI
影响 为评估和改进 LLM 应用针对提示注入攻击的安全性提供了一个新工具。
排序理由 该项目描述了一个用于测试 LLM 安全功能的***数据集,属于研究范畴。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →