研究人员开发了一个名为SceneJail的新框架,旨在利用视频多模态大语言模型(Video-MLLMs)中的漏洞。与以往仅关注视觉呈现的攻击不同,该方法利用视频场景中的上下文信息来绕过安全措施。SceneJail能够自适应地构建兼容的场景并搜索定制化的提示,以诱导GPT-4.1和Gemini3.5-Flash等模型产生违反策略的响应。 AI
影响 这项研究揭示了一种针对多模态AI的新型攻击途径,可能影响视频类大语言模型更鲁棒的安全机制的开发。
排序理由 研究论文,详细介绍了一种新的越狱AI模型的方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →