研究人员发现了一种新的视觉-语言模型(VLM)安全漏洞,可以植入模型架构中。这种“架构后门”通过表示学习插入,允许恶意行为者在特定触发器激活时微妙地改变模型的行为,而不影响其在干净输入上的性能。该攻击可能损害各种VLM应用(包括问答和图像生成)的完整性、安全性和公平性。提出的审计防御机制检查模型的执行逻辑,而不仅仅是其学习到的权重。 AI
影响 为AI供应链引入了一类新的安全威胁,可能影响已部署模型的完整性和安全性。
排序理由 详细介绍AI模型新型安全漏洞的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- Antonio Emanuele Cinà
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Representation steering
- ScienceCast
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →