一项新的研究论文探讨了即使在知识编辑程序之后,原始信息在AI模型中仍然存在的现象。该研究在GPT-2 XL上进行了三种不同的编辑方法(ROME、GRACE和约束微调),发现即使模型行为上反映了编辑后的信息,原始事实仍然可以高精度地从模型的隐藏状态中解码出来。值得注意的是,GRACE编辑器不修改基础模型权重,但仍然显示出原始事实的残留痕迹,这表明编辑主要是压制而非抹去知识。 AI
影响 表明当前的知识编辑技术可能无法完全移除不良信息,影响AI的安全性和可靠性。
排序理由 学术论文,详细介绍了关于AI模型行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →