PulseAugur
中
实时 01:27:21
English(EN) The Uncontrolled Variable: Vision-Language Refusal Is Conditioned on the Image-Attachment Interface, and Not Robust to Irrelevant Image Properties

视觉-语言模型显示不可靠的拒绝行为与图像存在相关

arXiv上的一篇新研究论文强调了视觉-语言模型的一个重大缺陷:它们的拒绝行为不一致地与图像的存在相关,而不是与请求的内容相关。研究人员发现,仅仅附加一个空白或无法读取的图像就会急剧增加良性提示的拒绝率,而对真正中性提示的影响很小。这表明模型的安全机制并不鲁棒,容易被无关的视觉线索操纵,导致对敏感话题采取过于谨慎的态度。 AI

影响 揭示了AI安全机制的潜在漏洞,表明模型可能因无关的图像线索而过于谨慎。

排序理由 一篇发表在arXiv上的研究论文,详细介绍了关于AI模型行为的具体技术发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

视觉-语言模型显示不可靠的拒绝行为与图像存在相关

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Haoyu Zhang, Yi Feng, Hanwen Liu, Shibo Zheng, Zhuoxi Wang, Yang Chen, Haowen Xu, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita ·

    不可控变量:视觉-语言拒绝受图像附件接口条件限制,对无关图像属性不鲁棒

    arXiv:2609.26174v2 Announce Type: replace-cross Abstract: We show that aligned vision-language models also condition refusal on a property of a request's form: whether an image is attached, holding everything the request asks fixed. Attaching a blank canvas, an image that cannot …