研究人员推出了一种新颖的大型语言模型微调优化器LoRA-TSD。该方法将每次更新视为固定秩矩阵流形上的切向量,并在该切空间内执行谱范数最速下降步。LoRA-TSD提供了一种比先前基于流形的方法便宜高达2.8倍的回缩方法,并在自然平稳性度量下为LoRA训练提供了首个全局收敛保证。在Llama-3.2-1B和Qwen3-32B等模型上的六个基准测试实验表明,LoRA-TSD的性能优于现有的LoRA优化器。 AI
影响 这项新的优化技术可能导致更高效、更有效的大型语言模型微调,从而降低计算成本并提高下游任务的性能。
排序理由 该集群包含一篇详细介绍大型语言模型微调新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →