研究人员开发了一种名为激活感知权重张量化(AWT)的新方法,利用张量网络技术来改进大型语言模型的压缩。AWT作为一种校准时包装器,在应用标准的张量网络分解之前,根据激活分布对权重矩阵进行预处理。这种方法通过减小困惑度差距和提高下游任务性能,在Llama 3.1 8B、Mistral 8B和Qwen2.5 7B等各种模型上一致地增强了张量化方法(如张量链TT和树张量网络TTN)的性能。 AI
影响 该方法通过减小大型语言模型的尺寸而不会显著降低性能,从而可能实现更高效的部署。
排序理由 该条目是一篇学术论文,详细介绍了一种新的LLM压缩方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Activation-Aware Weight Tensorization
- ARC challenge
- HellaSwag
- Llama-3.1:8b
- qwen2.5:7b
- Tensor-Train Decomposition
- transformer
- Tree Tensor Network State with Variable Tensor Order: An Efficient Multireference Method for Strongly Correlated Systems
- wikitext
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →