实体
$\mu$P
$\mu$P
PulseAugur coverage of $\mu$P — every cluster mentioning $\mu$P across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新研究揭示混合Transformer-SSM模型中的学习率迁移
一篇新研究论文探讨了混合架构的学习率(LR)缩放问题,该架构结合了Transformer和状态空间模型(SSM)模块,这些模块越来越多地用于生产语言模型中。研究发现,这些混合模型的实际实现,即使使用了简化的SSM,在各种宽度和深度下(高达十亿参数规模)也表现出接近零的学习率迁移差距。这种不变性归因于$\mu$P的初始化和学习率缩放,以及AdamW的逐参数归一化,它们共同维持了全局更新到权重的 Invariance 和局部组件的平衡。
-
Complete-muE 框架优化混合专家(MoE)模型的超参数迁移
研究人员推出 Complete-muE,一个旨在优化混合专家(MoE)模型超参数迁移的新颖框架。该系统通过实现密集前馈网络与各种 MoE 配置之间的有效超参数迁移,解决了现有工具的局限性。Complete-muE 利用双桥接系统来管理架构和 token 数量的变化,从而可以将在一个单一密集模型上调整的超参数近乎最优地应用于所有 MoE 设置。