研究人员探索了 1.5 亿以下参数模型中模型深度与宽度的影响,发现在使用相同的训练方法和数据的情况下,更深、更窄的架构(23 层 x 576 隐藏层)优于更宽、更浅的架构(53.5M vs 110M 参数)。较大的 110M 参数模型在 BLiMP 和 ARC-Easy 等基准测试中取得了更好的结果,且训练 token 更少,这表明在此参数范围内,深度比规模更关键。使用值残差和 Muon 优化器的进一步实验在 ARC-Easy 基准测试上显示出显著的改进。 AI
影响 证明了在较小的模型中,像深度这样的架构选择可能比参数数量更具影响力,为未来高效模型的设计提供了指导。
排序理由 这是一篇详细介绍模型架构实验和基准测试结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →