研究人员开发了一种方法来减轻与大型语言模型中的转向向量相关的安全风险。这些用于控制模型行为的向量可能会无意中削弱安全机制,并增加对有害请求的响应。新技术识别并移除了转向向量中导致这种安全退化的特定组件,在对预期转向能力影响最小的情况下恢复模型的安全性。这种方法为转向向量提供了事后修正,并为在不损害安全性的情况下应用模型干预提供了一种通用策略。 AI
影响 提供了一种在不牺牲可控性的情况下增强LLM安全性的方法。
排序理由 学术论文,详细介绍了一种改进LLM安全性方面的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →