研究人员调查了在低秩适应(LoRA)中用于微调大型语言模型的参数放置问题。他们的研究表明,对于监督微调(SFT),LoRA 适配器 B 矩阵中可训练参数的具体放置对性能没有显著影响。然而,在基于梯度的强化学习(GRPO)下,随机参数放置无法提升基础模型,而有针对性的放置则能恢复标准的 LoRA 准确率。这种差异归因于梯度结构,SFT 梯度稳定,而 GRPO 梯度接近正交,后者需要一种基于梯度的信息方法才能有效学习。 AI
影响 确定了有效的 GRPO 微调的关键参数放置,可能优化特定 LLM 适应任务的资源使用。
排序理由 该集群包含一篇详细介绍模型微调技术新发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →