研究人员推出了一种新颖的两阶段参数高效大型语言模型微调方法,称为LoCA(局部信用分配)。该方法旨在通过用单次校准过程替换重复的端到端反向传播来降低计算需求。LoCA通过拟合Transformer块内的局部映射来纠正预测错误,然后用于仅前向传播调优。在Qwen2.5和SmolLM2-1.7B模型上的评估表明,与LoRA相比,LoCA可以带来更低的交叉熵、更低的GPU峰值使用量以及更低的CPU内存和每轮时间。 AI
影响 LoCA的效率提升可能使LLM微调在计算能力较弱的硬件上得到更广泛的应用。
排序理由 该集群包含一篇详细介绍LLM调优新方法的学术论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →