PulseAugur
中
实时 13:25:30
实体 Jingyuan Huang

Jingyuan Huang

PulseAugur coverage of Jingyuan Huang — every cluster mentioning Jingyuan Huang across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_287130 ·

    强化学习教师在模型合并研究中产生更强的学生模型

    一篇新发表在arXiv上的研究论文,题为“Train4Merge: 一项关于基于OPD的模型合并的RL与SFT教师的受控单教师研究”,调查了在单策略蒸馏(OPD)模型合并中,用于创建专家模型的不同训练算法的有效性。研究人员比较了监督微调(SFT)和强化学习(RL)教师,发现RL教师在代理、推理和感知领域持续产生更强的学生模型。研究观察到,RL指导下的学生模型恢复了更多教师的性能增益,其中一个案例甚至超越了教师的性能。