研究人员开发了一个使用Bregman散度的统一框架,用于分析不同散度选择对神经网络优化器(特别是Shampoo)的影响。该框架连接了各种流行的散度,从而可以联合研究它们的影响。该研究通过经验分析了散度选择如何影响Kronecker近似,并与预处理中的有限样本误差相互作用,表明某些散度可以更好地减轻对经验二阶矩的低估。这些发现通过GPT-2预训练实验得到了验证,为改进Shampoo及相关优化技术提供了指导。 AI
影响 提供了一个理论框架,以指导更有效的神经网络优化器的开发,可能导致更快、更稳定的训练。
排序理由 该集群包含一篇学术论文,详细介绍了用于改进神经网络优化器的新理论框架和经验验证。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Bregman divergence
- Frobenius divergence
- GPT-2
- Hugging Face
- Kronecker approximation
- Kullback--Leibler divergence
- Shampoo
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →