一篇新研究论文在成员推理攻击(MIA)中引入了“未见类别”设置,这是人工智能安全和数据审计的关键工具。现有的MIA在实际场景中常常失败,因为它们需要访问有害内容的样本,而审计员可能在法律或道德上受到限制而无法获取。该论文证明,在这一新设置下,分位数回归攻击的性能显著优于最先进的方法,真实阳性率提高了11倍。这项工作突显了当前MIA工具的一个关键限制,并为致力于实际人工智能安全应用的从业者敲响了警钟。 AI
影响 引入了一种新颖的人工智能安全审计方法,可能改进对有害训练数据的检测。
排序理由 详细介绍人工智能安全研究新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →