研究人员在用于视频审核的多模态大语言模型 (MLLM) 中发现了一种新的安全漏洞,称为分布式隐式危害 (DIH)。这种情况发生在看似无害的视频组件组合在一起产生整体有害信息时,而当前的 MLLM 难以检测到这种现象。该研究提出了一个框架,生成了超过 9,000 个带注释的 DIH 视频,并对超过 30 个 MLLM 进行了基准测试,结果显示即使是前沿模型也存在显著的检测缺陷。 AI
影响 突出了 AI 视频审核中的一个关键安全盲点,可能影响内容安全系统,并需要新的检测方法。
排序理由 详细介绍 AI 模型新安全漏洞的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →