PulseAugur
实时 06:30:51
实体 Harmful Detection Heads

Harmful Detection Heads

PulseAugur coverage of Harmful Detection Heads — every cluster mentioning Harmful Detection Heads across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_231337 ·

    新研究揭示 LLM 安全电路,提高拒绝率

    研究人员在大型语言模型 (LLM) 中识别出一个多阶段安全电路,该电路控制其拒绝有害内容的能力。该电路包括有害检测头、安全神经元和拒绝头,它们按顺序工作,处理有害输入并生成安全响应。通过基于对该电路的理解进行的有针对性的干预和权重缩放,该研究证明了 LLM 在对抗性攻击下的安全率得到了显著提高,同时对一般准确性的影响最小。