研究人员应用Marchenko-Pastur随机矩阵理论分析了预训练Transformer的注意力权重,识别出代表主导学习结构的谱异常值。通过将Mistral-7B模型中识别出的这些异常值归零,模型在HellaSwag和MMLU等基准测试上的性能显著下降,接近随机猜测水平。对多个Transformer的分析揭示了重复出现的模式,例如Q投影包含最多的异常值,以及特定的残差流维度在各层中形成带状异常值,这表明可能在参数高效微调和结构化剪枝方面有应用潜力。 AI
影响 这项研究可能带来更高效的大型语言模型微调和剪枝方法。
排序理由 学术论文,详细介绍了Transformer注意力权重的新分析方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- HellaSwag
- Hugging Face
- Kasun Dewage
- Marchenko--Pastur
- Massive Multitask Language Understanding
- mistral:7b
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →