PulseAugur
实时 03:47:02
实体 AutoAttack

AutoAttack

PulseAugur coverage of AutoAttack — every cluster mentioning AutoAttack across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 5
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 5 条
  1. RESEARCH · CL_68166 ·

    新的IHO攻击方法旨在标准化LLM越狱评估

    研究人员开发了一种名为间接伤害优化(IHO)的新方法来评估大型语言模型(LLM)的对抗鲁棒性。这种黑盒攻击技术旨在高效且可跨不同模型和行为进行迁移,填补了LLM越狱评估标准化的空白。据报道,IHO的性能优于现有方法,即使面对分层防御也能奏效,并旨在为评估LLM安全性提供可靠基准。

  2. RESEARCH · CL_65266 ·

    新研究解决深度神经网络中的对抗鲁棒性问题

    几篇近期研究论文探讨了增强深度神经网络对抗鲁棒性的新方法。这些研究引入了诸如结合经验和认证防御的集成方法、噪声和双边滤波器的协同使用以及用于模拟对抗不确定性的贝叶斯框架等技术。此外,一篇论文提出了一个新的分类器,该分类器在判别能力和鲁棒性之间取得平衡,而另一篇则侧重于能够处理非加性扰动的对抗净化方法。

  3. TOOL · CL_62796 ·

    SHIELD框架提供强大的持续学习能力以抵御对抗性攻击

    研究人员开发了SHIELD,一个用于在对抗条件下进行鲁棒持续学习的新型框架。该系统集成了区间边界传播(Interval Bound Propagation)和超网络架构,能够高效地生成特定任务的参数,而无需重放缓冲区。SHIELD还采用了Interval MixUp,一种保证认证鲁棒性和更平滑决策边界的训练策略。评估表明,在对抗强对抗性攻击的基准测试中,SHIELD的表现优于现有方法,为对抗环境中的实际持续学习带来了显著的进步。

  4. TOOL · CL_20792 ·

    基于扩散的特征去噪增强了手写数字分类的鲁棒性

    研究人员开发了一个新颖的框架,用于鲁棒的手写数字分类,该框架结合了基于扩散的特征去噪和混合特征表示。该方法首先使用非负矩阵分解 (NNMF) 将输入图像转换为可解释的示例,并通过卷积神经网络 (CNN) 提取深度特征。然后组合这些特征,并通过在特征空间中添加高斯噪声进行扩散操作,然后使用一个去噪器网络来逆转此过程。该方法使用 AutoAttack 进行了评估,并证明了其有效性和鲁棒性,优于基线 CNN 模型。

  5. RESEARCH · CL_06359 ·

    新研究通过动态指导和公平基准来解决快速对抗性训练问题

    研究人员开发了一种名为分布感知动态指导(DDG)的新策略,以提高使用快速对抗性训练(FAT)训练的AI模型的鲁棒性。DDG通过根据样本置信度动态调整扰动幅度和监督信号,来解决灾难性过拟合和在干净输入上性能下降等问题。该方法旨在引导模型形成更一致的决策边界,并防止过度强调错误的训练信号。此外,还引入了一个全面的基准框架,以确保各种快速对抗性训练方法的公平和可复现的评估。