PulseAugur
中
实时 00:46:33
English(EN) The Plot Twist: Jailbreaking Unified Multimodal Models with a Three-Act NarrativeAttack

新的“叙事攻击”破解多模态AI模型

研究人员开发了一种名为叙事攻击(NarrativeAttack)的新型越狱技术,专门用于利用统一多模态模型(UMMs)的漏洞。该方法采用三幕叙事结构,模型生成图像用于铺垫和结局,将恶意事件隐藏在高潮部分。攻击最终以基于图像的猜谜游戏结束,迫使模型选择并响应隐藏的恶意查询。叙事攻击在Gemini 2.5-Flash上取得了显著成功,攻击成功率达到88.25%,凸显了UMMs中一个未被充分探索的漏洞以及加强安全对齐的必要性。 AI

影响 强调了多模态AI的一个新漏洞,可能影响未来AI系统的安全性和安全对齐。

排序理由 学术论文,详细介绍了一种破解AI模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的“叙事攻击”破解多模态AI模型

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Shaoxiong Guo, Tianyi Du, Lijun Li, Yuyao Wu, Jie Li, Jing Shao ·

    情节反转:用三幕叙事攻击破解统一多模态模型

    arXiv:2509.26473v2 Announce Type: replace Abstract: Unified Multimodal Understanding and Generation Models (UMMs) increasingly combine visual understanding and image generation within a single interactive workflow, making generated visual content available as later reasoning cont…