研究人员开发了XSPA,一种用于在视觉语言模型(VLMs)上创建对抗性扰动的新颖方法。该技术精心设计了不可察觉的X形稀疏扰动,可以显著降低VLM在包括零样本分类、图像字幕和视觉问答在内的多项任务上的性能。虽然XSPA会降低COCO等任务的准确性,但它作为VLM鲁棒性的受控压力测试,而不是一种普遍优越的攻击方法。 AI
影响 这项研究突显了视觉语言模型的潜在漏洞,促使对其鲁棒性和安全性进行进一步研究。
排序理由 该集群包含一篇详细介绍攻击视觉语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →