PulseAugur
实时 10:43:57
实体 Yash Sawant

Yash Sawant

PulseAugur coverage of Yash Sawant — every cluster mentioning Yash Sawant across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_204030 ·

    研究发现自适应 LoRA 秩分配在 RL 训练中失效

    一篇新的研究论文表明,自适应秩分配(对于 LoRA (Low-Rank Adaptation) 方法而言)在监督微调 (SFT) 中是有效的,但这种方法并不适用于强化学习 (RL) 环境,例如 Group Relative Policy Optimization (GRPO)。在 Qwen 2.5 1.5B 模型上使用 GSM8K 基准进行测试时,与均匀分配相比,这种自适应方法导致准确率下降了 4.5 个百分点。研究认为,RL 中更平…