研究人员开发了一个新颖的零查询越狱框架,旨在绕过文本到图像系统的安全过滤器。该方法利用了过滤器-生成器差异(FGD),即提示扰动被安全过滤器和图像生成器以不同的方式处理。通过识别标记化和语义层面的可观察差异,该框架在采用不需要目标系统直接访问的集成进化搜索之前,对高潜力候选者进行筛选。实验表明,攻击成功率显著提高,在多个管道和一项商业服务上均优于现有基线。 AI
影响 这项研究突显了AI安全过滤器潜在的漏洞,表明需要更强大的防御措施来抵御生成式AI系统中的对抗性攻击。
排序理由 学术论文,详细介绍了一种用于越狱AI系统的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Canada
- Filter-Generator Discrepancy
- Hugging Face
- Master of Health Science
- Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems
- Text-to-Image Systems
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →