PulseAugur
实时 09:34:18
实体 MM-SafetyBench

MM-SafetyBench

PulseAugur coverage of MM-SafetyBench — every cluster mentioning MM-SafetyBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_254892 ·

    新的 SPARK 框架通过修复 KV 内存来增强 VLM 的安全性

    研究人员开发了 SPARK,一个新颖的框架,旨在通过解决其多模态键值(KV)内存中的漏洞来增强视觉语言模型(VLM)的安全性。这种两阶段方法可以在不改变模型核心参数的情况下,识别并减轻嵌入文本和图像表示中的有害内容。SPARK 已在 LLaVA-OneVision-7B 和 Qwen2-VL-7B 等多个领先的 VLM 上成功减少了越狱攻击,同时在通用能力和语言质量基准上保持了高性能。

  2. TOOL · CL_191268 ·

    新的CASA方法提升了多模态LLM的安全对齐能力

    研究人员开发了CASA(Classification Augmented with Safety Attention),一种增强多模态大语言模型(MLLMs)安全对齐能力的新策略。CASA利用内部MLLM表示,在生成响应前预测一个二元安全令牌,并通过一个安全注意力机制进行指导,该机制对分类logits进行缩放。该方法旨在提高跨文本、图像和音频模态的恶意查询检测能力,而无需外部分类器或特定模态的微调。在MM-SafetyBench和Ja…

  3. TOOL · CL_53667 ·

    新型“Furina”攻击利用大型语言模型安全不稳定性

    研究人员开发了一种名为Furina的新型攻击方法,该方法利用了大型语言模型安全对齐方面的不稳定性。这种攻击利用了这样一个现象:微小的输入变化会导致不可预测的拒绝决策,而目前的检测方法未能很好地解决这种行为。Furina利用碎片化提示来诱导这种不稳定性,在安全基准测试中证明了其有效性,并强调了不确定性放大是关键漏洞。