研究人员开发了新的方法来检测和评估多语言大型语言模型(LLM)和视觉-语言模型(VLM)中的越狱漏洞。一种方法MLJailDe使用反向翻译和相对距离约束来创建一个多语言数据集,并提高LLM越狱检测的跨语言泛化能力,在未见过语言上达到了97.1%的F1分数。另一项研究引入了MLingualFC,这是一个VLM的基准测试,将有害指令编码成五种语言的流程图图像,揭示了显著的多语言安全差距,并表明视觉攻击可以绕过跨语言的安全对齐,尽管成功率因脚本而异。 AI
影响 凸显了多语言AI模型中关键的安全差距,需要改进跨语言安全对齐和评估。
排序理由 两篇研究论文介绍了评估LLM和VLM多语言越狱漏洞的新方法和基准测试。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →