PulseAugur
中
实时 16:55:29
实体 SafeGRPO

SafeGRPO

PulseAugur coverage of SafeGRPO — every cluster mentioning SafeGRPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_195987 ·

    SafeCap 框架通过字幕介导的强化学习增强 LVLM 的安全性

    研究人员开发了 SafeCap,一个旨在增强大型视觉语言模型 (LVLM) 安全性的新型强化学习框架。该方法训练一个策略模型,使其在生成最终答案之前生成与安全相关的图像字幕。字幕生成通过指导冻结的 LLM 做出安全决策的程度进行优化,鼓励模型暴露对安全响应至关重要的视觉线索。在多个安全性和效用基准上的评估表明,SafeCap 在各种模型设置下显著提高了安全性表现,同时保持或增强了视觉效用,其表现优于 SFT、DPO 和 SafeGRP…

  2. TOOL · CL_202788 ·

    SafeCap 框架使用图像字幕强化学习增强 LVLM 的安全性

    研究人员开发了 SafeCap,这是一个新颖的强化学习框架,旨在增强大型视觉语言模型 (LVLM) 的安全性。SafeCap 利用一种学习到的自字幕机制,模型首先为图像生成一个与安全相关的字幕,然后该字幕会指导生成最终的、对齐的响应。这种方法在安全基准测试中显示出显著的改进,在保持视觉效用的同时,其表现优于监督微调和直接偏好优化等现有方法,甚至有所提高。