一篇新发表在arXiv上的论文详细介绍了多类别逻辑回归的训练动态,为基于梯度的优化下的交叉熵风险建立了精确的扩展定律。研究表明,学习过程按类别顺序进行,从最频繁的类别到最不频繁的类别,并在此过程中识别出三个不同的阶段:初始平台期、幂律衰减期和最终收敛期。该研究还分析了在固定计算预算下模型容量与优化之间的相互作用,推导出了逻辑回归的计算最优扩展定律,该定律根据可用计算量规定了模型大小和训练时间。 AI
排序理由 学术论文,详细介绍了机器学习模型的理论扩展定律。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →