PulseAugur
实时 09:25:18
English(EN) Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier

新型攻击揭示视觉-语言模型置信度并非稳健

研究人员开发了新的方法来攻击视觉-语言模型的置信度分数,证明这些分数本身并非稳健。研究发现,包括仅图像扰动和隐藏状态干预在内的各种攻击,可以在不改变生成答案的情况下操纵置信度读数。这些攻击显著降低了置信度门控系统的准确性,有时甚至低于没有置信度门控的基线。研究结果表明,已部署系统中当前的置信度机制对完整性问题敏感,而不是内在稳健。 AI

影响 证明了视觉-语言模型中当前的置信度机制是脆弱的,可能影响其在安全关键应用中的可靠性。

排序理由 学术论文,详细介绍了针对AI模型置信度的新型攻击方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新型攻击揭示视觉-语言模型置信度并非稳健

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi ·

    模型在保持答案的攻击下的置信度:信息量-可操纵性前沿

    arXiv:2608.06571v1 Announce Type: cross Abstract: Deployed vision-language systems often gate their answers on confidence, making confidence robustness relevant to oversight. We study confidence readouts under white-box, image-only attacks constrained to preserve the generated an…