研究人员推出ShieldCLIP,一个旨在通过选择性处理有害内容来增强多模态基础模型安全对齐的新型框架。与以往将所有生成样本都视为不安全的先前方法不同,ShieldCLIP根据单个模态的安全状态进行区分。该方法得到了ViSUv2的支持,这是一个具有按模态安全标签的新数据集。ShieldCLIP已证明在减少各种任务中的有害输出方面是有效的,包括使用Stable Diffusion v1.4和SDXL等模型的跨模态检索和文本到图像生成,同时保留了原始嵌入空间的效用。 AI
影响 这项研究可能导致多模态AI系统中更强大的安全机制,在不损害良性内容的情况下减少有害输出。
排序理由 该集群描述了一篇介绍AI安全新框架和数据集的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →