PulseAugur
实时 06:54:33
实体 Gradient-based Reinforcement Learning

Gradient-based Reinforcement Learning

PulseAugur coverage of Gradient-based Reinforcement Learning — every cluster mentioning Gradient-based Reinforcement Learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_29395 ·

    LoRA 参数放置影响 GRPO 微调,不影响 SFT

    研究人员调查了在低秩适应(LoRA)中用于微调大型语言模型的参数放置问题。他们的研究表明,对于监督微调(SFT),LoRA 适配器 B 矩阵中可训练参数的具体放置对性能没有显著影响。然而,在基于梯度的强化学习(GRPO)下,随机参数放置无法提升基础模型,而有针对性的放置则能恢复标准的 LoRA 准确率。这种差异归因于梯度结构,SFT 梯度稳定,而 GRPO 梯度接近正交,后者需要一种基于梯度的信息方法才能有效学习。