Weight Normalization: A Simple Reparameterization to Accelerate Training of Deep Neural Networks
PulseAugur coverage of Weight Normalization: A Simple Reparameterization to Accelerate Training of Deep Neural Networks — every cluster mentioning Weight Normalization: A Simple Reparameterization to Accelerate Training of Deep Neural Networks across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的信息论度量“局部冗余”量化神经网络可塑性
研究人员引入了“局部冗余”,一种源自通用压缩理论的信息论度量,用于量化神经网络的可塑性。这一新指标旨在改进现有的度量方法,如有效秩和死神经元比例,这些方法在预测新任务上的表现方面显示出较差的相关性。所提出的方法使用合成记忆任务上的预期梯度范数平方作为局部冗余的可计算下界。实验表明,该度量能更好地预测图像分类和时间序列任务在持续学习场景下的下游性能。
-
权重范数在神经网络 Grokking 中的作用得到阐明
研究人员调查了神经网络中“Grokking”现象,即模型从记忆转向泛化。他们的发现表明,先前被认为是这种转变主要驱动因素的权重范数,主要充当 Logit 尺度的上游控制。通过直接操纵 Logit 尺度,研究人员可以控制 Grokking 延迟的整个范围,而权重范数仅产生微小的附加效应。发现这种关系取决于所使用的损失函数,均方误差显示出与交叉熵不同的机制。
-
权重归一化加速矩阵感知收敛
一篇新的arXiv论文详细介绍了权重归一化(WN)在过参数化矩阵感知问题中的益处。研究表明,WN与黎曼优化结合使用时,可以实现线性收敛,与不使用WN的方法相比,速度呈指数级提升。分析还表明,增加过参数化的程度可以多项式地提高迭代和样本复杂度。
-
神经网络“领悟”与权重范数动力学相关
研究人员调查了神经网络中“领悟”(grokking)现象,即模型在已拟合训练数据后仍发生泛化。他们的研究表明,权重范数在此延迟泛化中起着关键作用。通过在训练过程中干预和操纵权重范数,他们发现了一个始终达到的特定临界范数值 Wc,并且该值与网络的模块化基数呈幂律关系。此外,他们观察到将范数保持在 Wc 的固定倍数,会导致“领悟”延迟呈范数倍数的指数关系。