研究人员开发了 SafeCap,一个旨在增强大型视觉语言模型 (LVLM) 安全性的新型强化学习框架。该方法训练一个策略模型,使其在生成最终答案之前生成与安全相关的图像字幕。字幕生成通过指导冻结的 LLM 做出安全决策的程度进行优化,鼓励模型暴露对安全响应至关重要的视觉线索。在多个安全性和效用基准上的评估表明,SafeCap 在各种模型设置下显著提高了安全性表现,同时保持或增强了视觉效用,其表现优于 SFT、DPO 和 SafeGRPO 等现有方法。 AI
影响 这项研究可能有助于实现更强大的多模态人工智能系统安全机制,减少对抗性攻击的漏洞。
排序理由 该集群包含一篇详细介绍提高 AI 模型安全性新方法的 ist-paper。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →