研究人员开发了一种名为PoisonVID的新型攻击,可以绕过视频大语言模型(VideoLLMs)的安全措施。这些模型通过采样关键帧来审核用户生成的内容,但PoisonVID可以操纵这个采样过程。该攻击通过微妙地改变有害视频帧,使得VideoLLM的提示引导采样机制无法识别它们,从而有效地抑制安全警报。该方法在各种VideoLLM架构和有害内容类别中都显示出高成功率,甚至能够抵御多种防御机制。 AI
影响 这项研究揭示了当前视频大语言模型安全系统的一个关键漏洞,可能影响内容审核并需要新的防御策略。
排序理由 详细介绍针对AI模型新攻击方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →