PulseAugur
实时 02:22:33
English(EN) MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

新研究解决了多语言LLM和VLM的越狱漏洞问题

研究人员开发了新的方法来检测和评估多语言大型语言模型(LLM)和视觉-语言模型(VLM)中的越狱漏洞。一种方法MLJailDe使用反向翻译和相对距离约束来创建一个多语言数据集,并提高LLM越狱检测的跨语言泛化能力,在未见过语言上达到了97.1%的F1分数。另一项研究引入了MLingualFC,这是一个VLM的基准测试,将有害指令编码成五种语言的流程图图像,揭示了显著的多语言安全差距,并表明视觉攻击可以绕过跨语言的安全对齐,尽管成功率因脚本而异。 AI

影响 凸显了多语言AI模型中关键的安全差距,需要改进跨语言安全对齐和评估。

排序理由 两篇研究论文介绍了评估LLM和VLM多语言越狱漏洞的新方法和基准测试。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

新研究解决了多语言LLM和VLM的越狱漏洞问题

报道来源 [3]

  1. arXiv cs.AI TIER_1 English(EN) · Mirae Kim, Seonghun Jeong, Youngjun Kwak ·

    FENCE:一个金融和多模态越狱检测数据集

    arXiv:2602.18154v2 Announce Type: replace-cross Abstract: Jailbreaking poses a significant risk to the deployment of Large Language Models (LLMs) and Vision Language Models (VLMs). VLMs are particularly vulnerable because they process both text and images, creating broader attack…

  2. arXiv cs.CL TIER_1 English(EN) · Shuyu Jiang, Kaiyu Xu, Xingshu Chen, Hao Ren, Rui Tang, Yi Zhang, Tianwei Zhang, Hongwei Li ·

    一次越狱,多种语言:学习语言无关的意图表示以进行多语言越狱检测

    arXiv:2606.11202v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly deployed in applications for global multilingual users, yet safety training remains concentrated in dominant languages and has not progressed in parallel with multilingual capability, cr…

  3. arXiv cs.AI TIER_1 English(EN) · Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu ·

    MLingualFC:评估多语言视觉-语言模型中的越狱漏洞

    arXiv:2606.07706v1 Announce Type: cross Abstract: Vision-Language Models (VLMs) have demonstrated strong performance across multimodal tasks, yet their safety robustness remains an open challenge. While prior work has shown that structured visual prompts such as flowcharts can ef…