实体
Gradient-flow training
Gradient-flow training
PulseAugur coverage of Gradient-flow training — every cluster mentioning Gradient-flow training across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新理论解释了部分训练神经网络的训练动力学
研究人员开发了一个新的理论框架,以理解部分训练的三层神经网络的训练动力学。通过将平均场理论扩展到函数空间,他们证明了极限模型遵循具有时变核的函数梯度流。这种方法证明了训练损失的线性收敛,并展示了跨不同缩放机制下的特征学习。
-
神经网络训练对称性通过MSE损失产生守恒量
研究人员调查了训练数据中固有的对称性是否会在梯度流训练神经网络期间产生守恒量。他们的发现表明,对于解析和非多项式损失函数,数据对称性通常不会引入额外的运动积分。然而,在使用均方误差损失时,特定的数据增强技术可能导致守恒量的出现。该研究引入了一个使用“可张量化网络”的框架来模拟这种现象,该框架包括线性、多项式网络和Lightning Attention等架构。