研究人员在大型语言模型 (LLM) 中识别出一个多阶段安全电路,该电路控制其拒绝有害内容的能力。该电路包括有害检测头、安全神经元和拒绝头,它们按顺序工作,处理有害输入并生成安全响应。通过基于对该电路的理解进行的有针对性的干预和权重缩放,该研究证明了 LLM 在对抗性攻击下的安全率得到了显著提高,同时对一般准确性的影响最小。 AI
影响 提供了对 LLM 安全机制的更深入理解,可能导致更强大的对齐技术。
排序理由 该集群包含一篇研究论文,详细介绍了对 LLM 安全电路的新的机制可解释性研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →