研究人员开发了DeepInvert,一种新的半监督攻击方法,能够以显著高于先前方法准确度的方式从模糊化的语言模型嵌入中恢复原始Token。该攻击利用了标记的影子数据和未标记的目标嵌入,证明了当前的模糊化防御(如ObfusLM、SentinelLMs、TextObfuscator和DPNR)提供的保护不如预期。实验表明,DeepInvert在大多数防御上都优于现有攻击,突显了效用和安全之间的权衡,因为保留了效用的防御也保留了足够的结构以供反演。 AI
影响 这项研究突显了当前语言模型模糊化技术存在的重大漏洞,可能影响云端AI服务处理的敏感数据的安全性。
排序理由 学术论文,详细介绍了针对现有防御的新攻击方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →