PulseAugur
实时 10:57:30
English(EN) DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models

新的DeepInvert攻击绕过了语言模型的模糊化防御

研究人员开发了DeepInvert,一种新的半监督攻击方法,能够以显著高于先前方法准确度的方式从模糊化的语言模型嵌入中恢复原始Token。该攻击利用了标记的影子数据和未标记的目标嵌入,证明了当前的模糊化防御(如ObfusLM、SentinelLMs、TextObfuscator和DPNR)提供的保护不如预期。实验表明,DeepInvert在大多数防御上都优于现有攻击,突显了效用和安全之间的权衡,因为保留了效用的防御也保留了足够的结构以供反演。 AI

影响 这项研究突显了当前语言模型模糊化技术存在的重大漏洞,可能影响云端AI服务处理的敏感数据的安全性。

排序理由 学术论文,详细介绍了针对现有防御的新攻击方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的DeepInvert攻击绕过了语言模型的模糊化防御

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Zhicong Huang, Cheng Hong, Tao Wei ·

    DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models

    arXiv:2608.04477v1 Announce Type: cross Abstract: Cloud-based language model services routinely process prompts containing sensitive information. Obfuscation-based defenses---including ObfusLM, SentinelLMs, TextObfuscator, and DPNR---mitigate this risk by transforming prompt repr…