PulseAugur
实时 08:42:12
English(EN) SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap 框架通过字幕介导的强化学习增强 LVLM 的安全性

研究人员开发了 SafeCap,一个旨在增强大型视觉语言模型 (LVLM) 安全性的新型强化学习框架。该方法训练一个策略模型,使其在生成最终答案之前生成与安全相关的图像字幕。字幕生成通过指导冻结的 LLM 做出安全决策的程度进行优化,鼓励模型暴露对安全响应至关重要的视觉线索。在多个安全性和效用基准上的评估表明,SafeCap 在各种模型设置下显著提高了安全性表现,同时保持或增强了视觉效用,其表现优于 SFT、DPO 和 SafeGRPO 等现有方法。 AI

影响 这项研究可能有助于实现更强大的多模态人工智能系统安全机制,减少对抗性攻击的漏洞。

排序理由 该集群包含一篇详细介绍提高 AI 模型安全性新方法的 ist-paper。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

SafeCap 框架通过字幕介导的强化学习增强 LVLM 的安全性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng ·

    SafeCap:利用图像字幕强化学习提升LVLM安全性

    arXiv:2608.10513v1 Announce Type: cross Abstract: Large vision-language models (LVLMs) remain vulnerable to jailbreak attacks that exploit visual inputs to bypass safety alignment inherited from their language backbones. We propose SafeCap, a reinforcement-learning framework that…