研究人员在大型语言模型中发现了一种特殊的神经元,称为“削弱神经元”,它们在模型的输出中起着重要作用。这些神经元主要存在于 Transformer 模型后期层中,其输入和输出权重向量之间表现出负余弦相似度。尽管这些削弱神经元相对稀少,但它们激活频繁,并对模型的行为产生重大影响,尤其是在门控值为负时。 AI
影响 这项研究为分析大型语言模型的内部机制提供了一种新方法,有望提高模型的解释性和可控性。
排序理由 该集群包含一篇详细介绍 Transformer 模型内部工作原理研究发现的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- ScienceCast
- Sebastian Gerstner
- transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →