研究人员开发了一种名为Recover, Decode, Reguard的新防御机制,以对抗视觉语言模型(VLM)的越狱尝试。该系统旨在将图像内容转录并将其编码文本重述为其明文载荷,然后再将其传递给安全分类器,从而防止以各种格式伪装的有害请求绕过防御。虽然该增强器显示出潜力,但它仅部分弥合了差距,仍然存在显著的残留漏洞。Reguard层的进一步集成提高了安全性,但导致了很高的良性过度拒绝率,表明VLM防御在安全性和可用性之间存在持续的权衡。 AI
影响 这项研究突显了在保护VLM免受复杂越狱技术侵害方面所面临的持续挑战,并为防御增强提供了新的途径。
排序理由 学术论文,详细介绍了一种新的VLM防御机制。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →