AutoAttack
PulseAugur coverage of AutoAttack — every cluster mentioning AutoAttack across labs, papers, and developer communities, ranked by signal.
-
新的攻击方法结合代码和搜索技术绕过AI越狱防御
研究人员已经证明,代码补全编码和N选一搜索的结合可以有效地绕过AI模型中的自我检查越狱防御,在某些目标上成功率高达67%。这些依赖目标模型评估请求的防御措施之所以脆弱,是因为攻击利用了模型自身的评估过程。攻击的有效性因防御类型而异,代码编码在对抗转换防御方面表现更好,而字符搜索在对抗门控防御方面表现更好。该研究还识别并修复了其自身在贪婪解码下确定性攻击相关的缺陷。
-
新方法提升视觉语言模型的对抗鲁棒性
研究人员开发了一种名为置信度感知加权(CAW)的新方法,以提高CLIP等视觉语言模型的对抗鲁棒性。CAW通过优先处理不确定的对抗性样本,解决了并非所有输入对漏洞的贡献都均等的问题。该方法使用置信度感知损失函数和特征对齐正则化技术,在不牺牲泛化能力的情况下提高干净和鲁棒精度。实验表明,CAW在强对抗攻击下优于现有的最先进方法,并且内存效率更高。
-
新arXiv论文挑战AI鲁棒性测试方法
一篇新发布的arXiv预印本论文,题为“Adversarial Frontiers: Minimum-Norm Attack Ensembles for Robustness Evaluation”,提出了一种更鲁棒的AI模型鲁棒性测试方法。该论文认为,当前依赖单一扰动预算和特定范数的评估方法不稳定,且不能保证最坏情况下的性能。提出的框架利用了跨越不同范数和扰动预算的最小范数攻击,创建了“攻击前沿”和“防御前沿”,从而提供对对抗鲁棒性…
-
新的IHO攻击方法旨在标准化LLM越狱评估
研究人员开发了一种名为间接伤害优化(IHO)的新方法来评估大型语言模型(LLM)的对抗鲁棒性。这种黑盒攻击技术旨在高效且可跨不同模型和行为进行迁移,填补了LLM越狱评估标准化的空白。据报道,IHO的性能优于现有方法,即使面对分层防御也能奏效,并旨在为评估LLM安全性提供可靠基准。
-
新研究解决深度神经网络中的对抗鲁棒性问题
几篇近期研究论文探讨了增强深度神经网络对抗鲁棒性的新方法。这些研究引入了诸如结合经验和认证防御的集成方法、噪声和双边滤波器的协同使用以及用于模拟对抗不确定性的贝叶斯框架等技术。此外,一篇论文提出了一个新的分类器,该分类器在判别能力和鲁棒性之间取得平衡,而另一篇则侧重于能够处理非加性扰动的对抗净化方法。
-
SHIELD框架提供强大的持续学习能力以抵御对抗性攻击
研究人员开发了SHIELD,一个用于在对抗条件下进行鲁棒持续学习的新型框架。该系统集成了区间边界传播(Interval Bound Propagation)和超网络架构,能够高效地生成特定任务的参数,而无需重放缓冲区。SHIELD还采用了Interval MixUp,一种保证认证鲁棒性和更平滑决策边界的训练策略。评估表明,在对抗强对抗性攻击的基准测试中,SHIELD的表现优于现有方法,为对抗环境中的实际持续学习带来了显著的进步。
-
基于扩散的特征去噪增强了手写数字分类的鲁棒性
研究人员开发了一个新颖的框架,用于鲁棒的手写数字分类,该框架结合了基于扩散的特征去噪和混合特征表示。该方法首先使用非负矩阵分解 (NNMF) 将输入图像转换为可解释的示例,并通过卷积神经网络 (CNN) 提取深度特征。然后组合这些特征,并通过在特征空间中添加高斯噪声进行扩散操作,然后使用一个去噪器网络来逆转此过程。该方法使用 AutoAttack 进行了评估,并证明了其有效性和鲁棒性,优于基线 CNN 模型。
-
新研究通过动态指导和公平基准来解决快速对抗性训练问题
研究人员开发了一种名为分布感知动态指导(DDG)的新策略,以提高使用快速对抗性训练(FAT)训练的AI模型的鲁棒性。DDG通过根据样本置信度动态调整扰动幅度和监督信号,来解决灾难性过拟合和在干净输入上性能下降等问题。该方法旨在引导模型形成更一致的决策边界,并防止过度强调错误的训练信号。此外,还引入了一个全面的基准框架,以确保各种快速对抗性训练方法的公平和可复现的评估。