研究人员开发了一种名为状态化测试时遗忘(ST$^2$U)的新方法,用于在推理过程中控制大型语言模型中的受限知识。该方法通过实现跨轨迹的边界控制,解决了模型在初步纠正后重新访问不希望信息的问题。ST$^2$U通过将受限知识映射到低维坐标并应用最小的、跨生成token持久存在的修正,显著减少了知识的重新进入,同时保持了模型的能力。 AI
影响 该方法可以通过一种更持久的方式来防止LLM访问或生成不希望的信息,从而增强其安全性和对齐性。
排序理由 该集群包含一篇研究论文,详细介绍了一种控制大型语言模型中知识的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →