研究人员开发了ATLAS(自适应信任区域用于潜在对抗性搜索),一个新颖的基于查询的框架,旨在高效地发现可能导致黑盒学习系统失败的对抗性输入集。ATLAS将攻击生成构建为主动学习的水平集估计问题,结合了校准近似和局部-全局采样架构,以识别包含对抗性示例的输入空间区域。该方法旨在构建代表性的对抗性集合,准确反映目标模型的鲁棒性,在MNIST、CIFAR和ImageNet等标准和对抗性训练模型上优于现有的基于查询的黑盒攻击。 AI
影响 这项研究通过能够更好地识别漏洞,可能带来更鲁棒的AI系统。
排序理由 该集群包含一篇详细介绍机器学习模型对抗性攻击新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →