研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。 AI
影响 该方法可以显著减少微调大型语言模型所需的计算资源,使先进的定制化更加易于获得。
排序理由 该集群描述了一种在arXiv论文中提出的大型语言模型微调新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Higher-Order SVD (HOSVD)
- LLaMA2-7B
- LLaMA3-8B
- LoRA
- pre-trained attention weights
- RoBERTa-base
- RoBERTa-large
- SVD
- SuperLoRA
- transformer layers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →