PulseAugur
实时 09:05:04
English(EN) Borrowed Strength: Best-of-N Search over a Code EncodingBreaks Self-Check Jailbreak Defenses

新的VLM防御增强了对编码越狱的防护

研究人员开发了一种名为Recover, Decode, Reguard的新防御机制,用于对抗视觉语言模型(VLM)的越狱尝试。该系统旨在将图像内容转录并将其编码文本重述为其纯净的有效载荷,然后再将其传递给安全分类器,从而防止以各种格式伪装的有害请求绕过防御。虽然该增强器显示出潜力,但它只部分弥补了差距,仍然存在显著的残留漏洞。进一步集成一个重新防护层可以提高安全性,但会导致高度的良性过度拒绝率,表明VLM防御在安全性和可用性之间存在持续的权衡。 AI

影响 这项研究强调了在保护VLM免受复杂越狱技术侵害方面持续存在的挑战,并为防御增强提供了新的途径。

排序理由 学术论文,详细介绍了一种新的VLM防御机制。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的VLM防御增强了对编码越狱的防护

报道来源 [2]

  1. arXiv cs.LG TIER_1 English(EN) · Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Zijian Xiao, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita ·

    恢复、解码、再守护:针对编码视觉语言模型越狱的守护者无关防御增强

    arXiv:2607.26574v1 Announce Type: cross Abstract: Safety classifiers ("guards") are the dominant black-box defense for vision-language models, yet they judge an input's surface form, not its meaning: a harmful request re-encoded as set theory, formal logic, a rare language, code,…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    Borrowed Strength: Best-of-N Search over a Code EncodingBreaks Self-Check Jailbreak Defenses

    A self-check defense asks the target model to assess a request before answering it; SAGE, the strongest published instance, reports an average 99% defense success rate. We show it can be breached by composing two attacks that are individually harmless against it: an established c…