研究人员开发了一种新的基于谱系的方法,可以选择性地反转大型语言模型中的知识编辑。该方法旨在撤销特定的、不希望发生的事实更改,同时保留其他有益的编辑。该方法假设编辑稀疏地编码在主导奇异子空间中,并使用谱系分析来识别和移除编辑敏感的组件,使其不被编辑的权重影响。实验表明,该技术可以有效地反转目标编辑,而不影响不相关的信息,这为修复和维护语言模型提供了一个有前途的方向。 AI
影响 提供了一种更精确的方法来控制大型语言模型中的事实知识,从而提高安全性和可靠性。
排序理由 详细介绍修改大型语言模型的最新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →