研究人员开发了一种新颖的方法,用于剪枝大语言模型高层的注意力头以提高效率。该技术引入了一个自适应重缩放参数,以在剪枝后维持表示尺度,抵消潜在的幅度变化。在 LLaMA3.1-8B、Mistral-7B-v0.3、Qwen2-7B 和 Gemma2-9B 等模型上进行的各种任务实验表明,与现有的结构化剪枝方法相比,该方法在生成任务上表现更优。 AI
影响 这项研究通过减小 LLM 的规模和计算需求,可能带来更高效的 LLM 部署。
排序理由 该集群包含一篇详细介绍大语言模型新剪枝方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →