研究人员推出了MPS-Bench,一个旨在评估视觉语言模型(VLMs)个性化安全性的新基准。该基准包含5,181个源自真实图像的场景,并包含隐藏的用户配置文件,以测试VLMs如何处理敏感信息。对八个领先VLMs的评估显示,它们经常未能根据缺失的上下文进行延迟处理,没有一个在个性化安全方面得分高于5分中的2.6分。研究确定“视觉主导”是一个关键问题,即处理早期阶段的视觉信息可能会覆盖文本安全信号,导致不安全的回应。为解决此问题,开发了一种名为PRISM的新方法,它充当输入监视器,预测何时需要延迟处理,实现了0.978的高AUC。 AI
影响 凸显了VLMs在安全方面存在的关键局限性,可能影响多模态AI的未来开发和部署策略。
排序理由 该集群包含一篇学术论文,详细介绍了用于评估AI安全性的新基准和方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →