一篇新研究论文认为,由于超参数的敏感性,预测模型性能与模型大小之间关系的缩放定律在小规模下并不可靠。作者们证明,对于小规模实验而言,调优良好的超参数比模型大小更关键。他们还发现,随着模型规模的增大,超参数的敏感性会降低,从而更容易找到。该研究提出了一种新的以模型为中心的研究方法,并成功将其应用于确定Transformer架构中归一化层的最佳位置,从小规模实验中恢复了大规模结果。 AI
影响 表明优化的的的小规模实验可以产生以前认为需要大型模型才能获得的见解,从而可能降低研究成本。
排序理由 该集群包含一篇讨论AI模型缩放和超参数调优的研究论文。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- arXivLabs
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv Recommender
- Influence Flower
- pre-normalization
- Scaling Laws for Autoregressive Generative Modeling
- ScienceCast
- Small-Scale Experiments: Are We There Yet?
- Transformer++
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →