研究人员开发了一个名为 CRACK 的新颖多智能体辩论框架,用于绕过文本到图像模型的安全过滤器。该框架使用攻击智能体、防御智能体和裁判智能体来迭代地优化提示,识别不同安全层之间的冲突,并保持原始的有害意图。CRACK 在生成不适合工作场所的内容方面表现出很高的成功率,即使在复杂的安全配置下也是如此,同时所需的查询次数比现有方法少,并保持了语义保真度。 AI
影响 这项研究突显了当前文本到图像安全机制的漏洞,可能会推动更强大的防御措施的开发。
排序理由 该集群包含一篇详细介绍越狱 AI 模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →