一项新的研究论文介绍V-DEAL,一个旨在识别视频大型语言模型(Video LLM)安全漏洞的诊断框架。研究发现,与明确有害的查询配对相比,有害视频与良性查询配对更容易受到攻击。V-DEAL分析模型行为、理解和内部表征,以查明这种“理解-拒绝耦合失败”,揭示与文本理解相比,视觉理解触发的拒绝倾向较弱。研究人员还开发了一种提示注入方法,该方法显著降低了攻击成功率,为增强Video LLM安全性提供了一个实用的解决方案。 AI
影响 引入了一种诊断和缓解视频LLM中安全风险的新方法,可能改善其在现实世界中的部署。
排序理由 研究论文,详细介绍了AI安全的新诊断框架。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- V-DEAL
- Video Large Language Models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →