PulseAugur
中
实时 09:36:23
实体 BackdoorBench

BackdoorBench

PulseAugur coverage of BackdoorBench — every cluster mentioning BackdoorBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_284353 ·

    新的TARE方法可准确衡量AI后门防御成本

    一篇新研究论文介绍了一种名为TARE的方法,旨在更准确地评估AI模型中后门防御的成本。传统方法衡量干净准确率的下降,这可能具有误导性,因为它无法区分防御对模型的影响和后门的实际移除。TARE通过在一个“永不被投毒的双生模型”上运行防御来解决这个问题,从而允许研究人员通过衡量双生模型损失的性能来分离防御的真实成本。该论文还提供了诸如签名TARE列和TARE-Z(用于种子稳定防御的估计器)等工具,以改进这些安全措施的评估。

  2. TOOL · CL_51491 ·

    新方法利用功能归因检测异常AI行为

    研究人员开发了一种名为机制性异常检测(MAD)的新方法,将异常检测重新构建为功能归因问题。该方法使用影响函数来衡量测试样本与参考集之间的耦合,并在归因失败时标记异常行为。该方法在检测视觉模型中的后门方面表现出最先进的性能,并且在大型语言模型(LLM)方面显示出显著的改进,即使是针对混淆模型。除了后门,MAD还可以识别对抗性样本和分布外样本,为识别已部署AI系统中的异常行为提供了一种模型无关的工具。