PulseAugur
实时 15:43:55
English(EN) ADS-C: Antidistillation Sampling for Classification

新的抗蒸馏采样保护分类模型免受知识蒸馏攻击

研究人员开发了ADS-C,一种新颖的抗蒸馏采样技术,旨在保护分类模型免受知识蒸馏攻击。与以前的方法不同,ADS-C以输入和置信度边际预算为依赖的方式扰乱模型的输出分布。这种方法可证明地保留了防御模型的top-1预测准确性,同时显著降低了在包括CIFAR-100、CIFAR-10和Tiny-ImageNet在内的各种数据集上蒸馏学生模型的性能。 AI

影响 这项研究引入了一种新颖的知识蒸馏防御机制,可能增强分类模型的安全性和专有性。

排序理由 详细介绍AI安全新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的抗蒸馏采样保护分类模型免受知识蒸馏攻击

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Khawaja Abaid Ullah, Mohammad Javad Khojasteh ·

    ADS-C:分类的抗蒸馏采样

    arXiv:2607.15467v1 Announce Type: new Abstract: Knowledge distillation enables an adversary to replicate a proprietary classifier by querying its prediction interface and training a surrogate on the returned probability vectors. Antidistillation sampling, proposed for large langu…