研究人员开发了一个双对抗微调框架,以提高 LLaVA 和 GPT-4V 等大型视觉语言模型 (LVLM) 在对抗攻击下的鲁棒性。与以往仅限于单任务场景的方法不同,这种新方法通过联合优化视觉和语义监督信号,增强了跨多个任务的泛化能力。实验表明,该框架在分类、图像字幕和视觉问答等任务的对抗鲁棒性方面优于现有的最先进方法。 AI
影响 这项研究可能带来更安全、更可靠的大型视觉语言模型,这对于那些对对抗性操纵敏感的应用至关重要。
排序理由 该集群描述了一篇提出新框架以提高 AI 模型鲁棒性的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →