研究人员开发了MemJack,一个旨在利用自然图像测试视觉语言模型(VLMs)安全性的新颖框架。这个记忆增强的多智能体系统在良性图像中发现可重复使用的视觉锚点,以制造越狱攻击。MemJack还催生了MemJack-Bench,一个包含超过113,000个多模态越狱轨迹的数据集,用于评估和改进VLMs的安全对齐。在测试中,MemJack表现出显著的有效性,在Qwen3-VL-Plus上实现了71.48%的攻击成功率,并突显了当前安全对齐VLMs存在的重大漏洞。 AI
影响 突显了当前视觉语言模型安全对齐方面的重大漏洞,可能推动新的防御策略。
排序理由 该集群包含一篇学术论文,详细介绍了一种攻击AI模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →