一个名为CS-Guard的新基准测试已被开发出来,用于评估大型语言模型(LLM)防护栏在防止生成恶意代码方面的有效性。该基准测试包括超过1000个文本到代码生成的提示和331个代码到代码生成的提示,并结合了越狱攻击和一种新颖的虚构场景攻击。对七个LLM上的九个防护栏进行的实证测试显示出显著的漏洞,文本到代码生成的攻击成功率高达50%,代码到代码生成的攻击成功率接近100%,这引起了对实际软件开发的担忧。 AI
影响 突出了LLM中关键的安全漏洞,可能影响AI在敏感代码生成任务中的应用。
排序理由 该项目描述了一个新的学术基准测试和研究论文,评估LLM安全防护栏。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX Code Finder for Papers
- code generation
- Connected Papers
- CORE Recommender
- CS-Guard
- DagsHub
- Financial Services Agency
- Gotit.pub
- Hugging Face
- Large language models
- Litmaps
- LLM guardrails
- malware
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →