研究人员开发了一种名为对抗性风格优化(ASO)的新方法,以增强针对多模态大语言模型(MLLMs)的越狱攻击。ASO 利用基于组相对策略优化(GRPO)的代理来微调图像编辑模型,然后该模型对对抗性图像应用风格化修改。这种方法利用了 MLLMs 中发现的一种风格化不一致性,即它们的安全机制容易受到特定视觉风格的影响,即使内容被理解。实验表明,ASO 显著提高了现有攻击的成功率,突显了风格化偏差是红队测试 MLLMs 的可扩展向量。 AI
影响 这项研究揭示了多模态模型的一个新漏洞,为提高其安全性以及抵御风格化操纵的鲁棒性提供了潜在途径。
排序理由 该集群包含一篇详细介绍攻击 AI 模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Adversarial Style Optimization
- arXiv
- Group Relative Policy Optimization
- Multimodal Large Language Models
- Structurally-Tiered Reward Function
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →