研究人员开发了新的方法来攻击视觉-语言模型的置信度分数,证明这些分数本身并非稳健。研究发现,包括仅图像扰动和隐藏状态干预在内的各种攻击,可以在不改变生成答案的情况下操纵置信度读数。这些攻击显著降低了置信度门控系统的准确性,有时甚至低于没有置信度门控的基线。研究结果表明,已部署系统中当前的置信度机制对完整性问题敏感,而不是内在稳健。 AI
影响 证明了视觉-语言模型中当前的置信度机制是脆弱的,可能影响其在安全关键应用中的可靠性。
排序理由 学术论文,详细介绍了针对AI模型置信度的新型攻击方法。[lever_c_demoted from research: ic=1 ai=1.0]
- answer-string accuracy
- confidence channels
- correctness-label-aware attacks
- defense estimators
- defense families
- hidden-state interventions
- text-model activation-space replication
- token-probability attack
- uniform amplitude certificate
- Vision-Language Systems
- visual question answering benchmarks
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →