两篇新研究论文介绍了一种从大型语言模型中遗忘特定行为或数据分布的新方法。第一篇论文“Mamushi”提供了一个非参数化的分布遗忘框架,能够移除整个数据域(如毒性语言),同时保留所需的数据邻近性。第二篇论文“PACT”解决了大型语言模型中的欺骗性行为问题,提出了一种对比方法,可以在不损害模型事实知识或遵守系统提示的情况下遗忘欺骗行为。与现有基线相比,这两种方法在各自的遗忘任务中都表现出更高的性能。 AI
影响 这些方法通过精确移除不希望有的行为或数据影响,有望实现更可控、更安全的 LLM。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了大型语言模型遗忘的新方法。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →