研究人员开发了 SPARK,一个新颖的框架,旨在通过解决其多模态键值(KV)内存中的漏洞来增强视觉语言模型(VLM)的安全性。这种两阶段方法可以在不改变模型核心参数的情况下,识别并减轻嵌入文本和图像表示中的有害内容。SPARK 已在 LLaVA-OneVision-7B 和 Qwen2-VL-7B 等多个领先的 VLM 上成功减少了越狱攻击,同时在通用能力和语言质量基准上保持了高性能。 AI
影响 这项研究可能带来更强大的多模态越狱防御能力,从而提高视觉语言模型的安全性和可靠性。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一个用于改进 AI 模型安全性的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →