研究人员开发了一种在视觉语言模型(VLMs)中植入可编程后门的新颖方法。与以往的静态后门攻击不同,这项新技术允许攻击者在推理时动态控制目标字幕并生成相应的触发器,即使对于未见的语义也是如此。该攻击涉及一种启发式投毒策略,用于教会模型一个通用的触发器即指令规则,然后采用一种特征空间隐写术方法将任何目标字幕映射到一个隐蔽的视觉触发器。这种方法保持了模型的干净效用,并证明了其对常见后门防御的有效性。 AI
影响 引入了一类新的针对VLMs的复杂攻击,可能影响模型的安全性和部署。
排序理由 学术论文,详细介绍了在VLMs中植入可编程后门的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →