一个名为V-DEAL的新诊断框架已被开发出来,用于识别视频大语言模型(LLM)中的安全漏洞。研究人员发现,与有害查询配对的有害视频比与良性查询配对的有害视频更容易受到攻击。V-DEAL分析模型的行为、理解和内部表征来查明这个问题,揭示了虽然模型能准确识别有害内容,但与文本理解相比,在涉及视觉理解时,其拒绝倾向较弱。还引入了一种使用提示注入的干预方法,显著降低了攻击成功率。 AI
影响 引入了一种改进视频LLM安全性和可靠性的新颖方法,可能影响其在敏感应用中的部署。
排序理由 详细介绍视频LLM新诊断框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- V-DEAL
- Video Large Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →