发布了两个开源项目来对抗针对大型语言模型的提示注入攻击。第一个项目由BordairAPI开发,采用两阶段检测系统,结合了快速的正则表达式网关和量化的DeBERTa-v3模型,并包含来自游戏的真实攻击数据。第二个项目adi-shield专注于标记不可信数据源,并在代理执行指令前检测注入的指令,而不依赖于LLM本身。 AI
影响 为开发者提供开源工具,以增强LLM应用程序在对抗提示注入方面的安全性。
排序理由 用于检测提示注入攻击的工具的开源发布。
- adi-shield
- adi_shield.bus.Signal
- CWE-1427
- Evaluate
- GNU Affero General Public License
- InjectionShield
- Pedro Sordo Martínez
- ruff
- trajectory-sentinel
- version 3.0 or later
- DeBERTa-v3
- ONNX
- prompt injection
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →