研究人员开发了一种名为目标主动搜索(TAS)的新型攻击,可以从未学习的AI模型中提取遗忘的提示。与先前假设已知遗忘提示的方法不同,TAS利用保留的数据和黑盒访问来识别和重构提示本身。实验表明,TAS在识别遗忘实体方面达到了100%的准确率,并且与朴素探测方法相比,查询次数显著减少的情况下,重构了高达95%的提示。 AI
影响 这项研究突显了AI遗忘技术的一个潜在漏洞,表明即使在数据删除后,敏感信息仍可能被恢复。
排序理由 该集群包含一篇学术论文,详细介绍了一种从AI模型中提取信息的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- CORE Recommender
- DagsHub
- Direct Preference Optimization
- Hugging Face
- IArxiv Recommender
- LUNAR
- Targeted Active Search
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →