adversarial example
PulseAugur coverage of adversarial example — every cluster mentioning adversarial example across labs, papers, and developer communities, ranked by signal.
-
联邦学习面临新的对抗性攻击和防御研究 · 跟踪 2 个来源
两篇最新的 arXiv 论文探讨了联邦学习 (FL) 框架中对抗性攻击和防御的挑战。第一篇论文研究了在 FL 中对 Vision Transformers 进行对抗性训练的可行性,并提出了一种名为 FedWAvg 的新聚合方法,以提高非独立同分布 (non-IID) 数据上的鲁棒准确性。第二篇论文分析了对抗性样本在 FL 中跨不同客户端模型的可迁移性,并引入了一种基于对抗性训练的防御机制来缓解这些攻击,提供了对系统漏洞的理论见解。
-
联邦学习面临新的对抗性攻击与防御
本文探讨了联邦学习(FL)系统在面对包括投毒、拜占庭攻击和对抗性样本攻击在内的各种对抗性攻击时的脆弱性。研究人员分析了不同客户端模型之间对抗性样本的可迁移性,以了解其对数据分布的影响。为了应对这些威胁,开发了一种基于对抗性训练的防御机制,利用了模型鲁棒性的可迁移性。所提出的方法在真实世界数据集上进行了评估,证明了其在现有最先进技术上的性能提升。
-
New Perspective-Invariant Attack Enhances Adversarial Example Transferability
研究人员开发了一种名为透视不变攻击(PIA)的新方法,以增强深度神经网络中对抗样本的可迁移性。与使用有限局部变换的先前方法不同,PIA采用多自由度顶点采样策略来覆盖从简单平移到复杂透视映射的透视变换层级。这种方法生成几何上多样化的变体,减少了对抗性扰动对代理模型的过拟合,并提高了跨模型的可迁移性。进一步的扩展PIA-Mix将透视变换与辅助方法相结合,以获得更大的效果,在各种网络架构和多模态大型语言模型上都优于现有的最先进攻击。
-
AI生成图像检测器易受对抗性攻击
研究人员发现,旨在无需训练即可识别AI生成图像的基于重建的检测器容易受到对抗性攻击。这些攻击会操纵图像以人为地增加重建误差,导致检测器将假图像错误地分类为真实图像。研究发现,这些对抗性样本可以在不同的检测器之间转移,这凸显了这种检测方法的基本弱点。
-
对使用世界模型的具身AI的安全威胁和防御进行了调查
本文调查了利用世界模型的具身AI系统的安全状况。文章详细介绍了这些预测核心在实现高级规划的同时,也引入了新的漏洞。研究追溯了从数据构建到长期适应的世界模型整个生命周期中的威胁,并将诸如投毒、后门和提示注入等攻击归类于世界状态和学习到的动力学。文章还讨论了世界模型作为潜在安全护盾和预测性安全幻觉来源的双重作用,并提出了防御和评估协议。
-
新的物理攻击方法使用红外光攻击光流估计网络
研究人员开发了一种新颖的方法,使用红外光实时物理攻击光流估计网络 (OFENs)。该方法预先生成大量对抗性样本并动态显示它们,从而能够在不改变受害者系统的情况下进行精确的目标攻击。该技术在各种光照条件、物体速度和放置下均显示出有效性,显著削弱了网络的光流估计能力。
-
新框架利用因果推理检测对抗性AI样本
研究人员推出了一种新颖的框架CausAdv,旨在检测深度学习模型中的对抗性样本,特别是用于计算机视觉的卷积神经网络(CNN)。该方法利用因果推理和反事实分析,通过检查最后一个卷积层中滤波器学习到的因果和非因果特征来识别恶意输入。通过分析干净样本和对抗性样本在反事实信息(CI)上的分布,CausAdv证明对抗性样本表现出独特的CI模式,从而无需单独训练的检测器即可进行检测。
-
新的防御方法Random Logit Scaling保护AI模型免受对抗性攻击
研究人员推出了一种名为Random Logit Scaling (RLS)的新型防御机制,旨在保护深度神经网络免受基于分数的黑盒对抗性样本攻击。RLS作为一种后处理步骤,可以轻松集成到现有机器学习模型中。通过输出随机缩放的logits,RLS旨在迷惑攻击者,同时保持模型的准确性并最小化置信度得分的失真。所提出的防御方法已证明能显著降低当前最先进攻击的成功率。
-
新框架统一检测AI内容、幻觉和水印
研究人员开发了一种新颖的统一框架,用于检测AI生成的内容和伪影,包括LLM文本、幻觉、水印和对抗性示例。该方法利用马氏距离得分(MDS),并通过采用鲁棒的深度表示协方差矩阵估计器来准确表征“正类”(例如,人类生成的文本)。该框架包括用于逐例和逐单元最小协方差行列式(MCD)估计器的有效优化算法,并展示了高击穿点特性。
-
新研究通过新颖的蒸馏和测试方法来提升AI鲁棒性 · 跟踪8个来源
研究人员正在探索增强神经网络对抗鲁棒性的新方法。一种名为AD-CERT的方法结合了对抗蒸馏和区间界传播,在鲁棒性基准测试上取得了最先进的认证性能。另一种技术,激活放大与衰减(A3),使用轻量级插件模块动态重缩放激活,以最小的开销提高鲁棒性。此外,研究还调查了输入维度的作用,发现更高维度通常更容易构建和控制对抗样本。来自Resemble AI的Proteus框架通过系统地应用音频转换来自动化音频深度伪造检测器的对抗鲁棒性测试。