研究人员开发了Caliber,一种针对评分API模型提取攻击的新型防御机制。Caliber通过向内部logits添加高斯噪声来工作,这会削弱用于训练代理模型的监督信号。该系统为恢复干净logits提供了可证明的每输入查询成本,并在众多模型-数据集组合中展示了0.6-1.4%的平均绝对相对误差。 AI
影响 引入了一种保护AI模型免受提取的新方法,可能提高API提供商的安全性。
排序理由 该集群包含一篇详细介绍模型提取新防御机制的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →