实体
Mingyang Song
Mingyang Song
PulseAugur coverage of Mingyang Song — every cluster mentioning Mingyang Song across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
RAZOR方法在不牺牲推理能力的情况下精简大型语言模型专家
研究人员开发了RAZOR,一种在不显著降低推理能力的情况下精简混合专家(MoE)模型中专家的新方法。与以往关注专家频率或孤立贡献的方法不同,RAZOR通过衡量专家删除造成的损害来评估功能可替换性。这种无需训练的方法使用共识残差来计算删除专家所产生的确切输出变化,仅通过前向传播即可实现精简。RAZOR在多个大型语言模型和专家移除预算上均表现出卓越的性能,在以推理为中心的任务上优于现有方法。
-
新的强化学习框架使用语言进行自适应指导;调查涵盖大语言模型蒸馏技术 · 跟踪 2 个来源
研究人员推出了一种名为“带语言指令的分层强化学习”(HRLLI)的新型框架,该框架通过在决策过程中动态选择相关的自然语言指导来提高强化学习的效率。这种被称为“选择即行动”(Select-to-Act)的方法将指令分解为特定阶段的元素,使高层策略能够指导低层策略进行自适应动作选择。在RTFM基准上的实验表明,HRLLI优于现有的指令条件强化学习基线。此外,一项调查回顾了大语言模型的“同策略蒸馏”(OPD)技术,解决了将前沿能力转移到更小…