研究人员开发了QK-Wanda,一种用于剪枝大型语言模型的新颖方法,它改进了现有的Wanda技术。QK-Wanda将线性投影中的查询和键耦合起来,与Wanda相比,显著降低了重建误差。虽然QK-Wanda比Wanda稍慢,但它在Llama 2 70B等模型上展示了实质性的下游性能提升,改善了困惑度和零样本准确率。然而,QK-Wanda的有效性因模型而异,如在Llama 3.1 70B上所示,这表明局部重建误差并不总是整体模型质量的完美预测指标。 AI
影响 引入了一种更有效的剪枝技术,可能导致更高效的大型语言模型部署。
排序理由 该集群包含一篇详细介绍剪枝大型语言模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- A100
- H200
- Llama 2
- Llama 2 70B
- Llama 3
- Llama 3.1 70B
- QK-Wanda
- Qwen2.5
- Qwen2.5-72B
- TinyLlama
- Wanda
- WikiText-2
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →