一篇新的研究论文评估了用于在消费级GPU上个性化小语言模型(SLM)的各种参数高效微调(PEFT)方法。该研究比较了五种方法——全参数微调、LoRA、LoRA+、QLoRA和BitFit——在不同的SLM架构上,包括基于Transformer的模型(如TinyLlama-1.1B和Qwen3-1.7B)以及基于SSM的模型(如Mamba-1.4B和Mamba-2-1.3B)。结果表明,LoRA+通常是最能耗高效的方法,而QLoRA在减少Transformer模型的峰值VRAM使用方面表现出色,这表明优化的PEFT技术为端侧SLM部署提供了一条可行的途径。 AI
影响 LoRA+和QLoRA等优化的PEFT方法能够更高效地对小语言模型进行端侧个性化,降低VRAM和能耗成本。
排序理由 评估多种PEFT方法在不同SLM和基准测试上的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →