PulseAugur
实时 08:37:58
English(EN) V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

新的V-DEAL框架诊断视频LLM中的安全缺陷

一个名为V-DEAL的新诊断框架已被开发出来,用于识别视频大语言模型(LLM)中的安全漏洞。研究人员发现,与有害查询配对的有害视频比与良性查询配对的有害视频更容易受到攻击。V-DEAL分析模型的行为、理解和内部表征来查明这个问题,揭示了虽然模型能准确识别有害内容,但与文本理解相比,在涉及视觉理解时,其拒绝倾向较弱。还引入了一种使用提示注入的干预方法,显著降低了攻击成功率。 AI

影响 引入了一种改进视频LLM安全性和可靠性的新颖方法,可能影响其在敏感应用中的部署。

排序理由 详细介绍视频LLM新诊断框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的V-DEAL框架诊断视频LLM中的安全缺陷

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zhetong Zhang, Honghao Fu, Miao Xu, Yiwei Wang, Yujun Cai ·

    V-DEAL:将视频安全去校准诊断为理解-拒绝耦合故障

    arXiv:2607.21151v1 Announce Type: new Abstract: As Video Large Language Models are increasingly deployed in real-world applications, ensuring their safety alignment has become critical. Counterintuitively, we find that harmful videos paired with benign queries achieve higher atta…