研究人员发现了一种与令牌修剪技术相关的视觉语言模型(VLM)的新漏洞。令牌修剪技术通过移除冗余的视觉令牌来加速模型性能。这种被称为“修剪诱导的恶意放大”(Pruning-Induced Malicious Amplification)的漏洞,在移除良性背景令牌后,会导致模型注意力集中在恶意的前景令牌上,从而无意中放大有毒语义。为了应对这一问题,开发了一种名为“安全感知修剪”(Safety-Aware Pruning, SAP)的新即插即用机制。SAP在推理时识别恶意锚点,恢复良性令牌并重新分配注意力,在不牺牲效率或效用的情况下,显著降低了对抗性攻击的成功率。 AI
影响 识别出与优化技术相关的VLM新类漏洞,可能影响多模态AI系统的安全部署。
排序理由 详细介绍VLM新漏洞和缓解策略的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- Pruning-Induced Malicious Amplification
- Query-based Compression
- Safety-Aware Pruning
- Token Pruning
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →