研究人员开发了CASA(Classification Augmented with Safety Attention),一种增强多模态大语言模型(MLLMs)安全对齐能力的新策略。CASA利用内部MLLM表示,在生成响应前预测一个二元安全令牌,并通过一个安全注意力机制进行指导,该机制对分类logits进行缩放。该方法旨在提高跨文本、图像和音频模态的恶意查询检测能力,而无需外部分类器或特定模态的微调。在MM-SafetyBench和JailbreakV-28k等基准测试上的评估表明,CASA在保持对良性输入的效用的同时,显著降低了攻击成功率。 AI
影响 增强了多模态LLM抵御恶意输入的鲁棒性,有望改善其在实际应用中的安全部署。
排序理由 关于AI安全新方法的 ist 论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →