研究人员发现,大型语言模型中的 Transformer 拒绝机制并非弥散编码,而是由结构化、可识别的机制组装而成。通过分解拒绝引导,他们发现注意力(attention)和 MLP 组件的稀疏子集,以及特定的残差流(residual stream)维度,足以重现完整的行为效果。这表明拒绝行为是通过这些集中的机制来表示和引导的,为理解其功能奠定了基础。 AI
影响 识别出 LLM 中拒绝行为的具体、可引导的机制,可能有助于安全和控制研究。
排序理由 该集群包含一篇详细介绍 Transformer 拒绝机制研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- activation steering
- arXiv
- Hugging Face
- large language model
- MLP components
- refusal steering
- residual stream dimensions
- transformer
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →