研究人员开发了一个名为WebMirage的新框架,用于测试由大型视觉语言模型驱动的网络代理的安全性。这些代理会解析网页并执行浏览器操作,但现有的安全测试主要侧重于模型操纵而非端到端鲁棒性。WebMirage会精心制作局部视觉扰动,欺骗代理选择攻击者控制的内容并执行恶意浏览器操作。在评估中,WebMirage实现了91.9%的攻击成功率,显著优于先前的方法,并且对代理级别的防御仍然有效。 AI
影响 凸显了AI驱动的网络代理中关键的安全漏洞,需要改进防御措施以实现鲁棒的浏览器执行。
排序理由 该集群包含一篇研究论文,详细介绍了一个用于测试AI安全性的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →