实体
Deep Linear Networks
Deep Linear Networks
PulseAugur coverage of Deep Linear Networks — every cluster mentioning Deep Linear Networks across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
树张量网络揭示了尽管有困难目标,但仍存在良性损失景观
研究人员探索了深度神经网络为何尽管复杂但实际上通常能有效学习的理论基础。一项使用树张量网络(TTNs)的新研究表明,即使是具有内在学习困难目标的模型也可以拥有良性损失景观。研究结果表明,学习复杂目标的困难可能源于由秩亏缺引起的高阶退化鞍点,而不是局部最小值。
-
两个训练时钟理论解释Grokking现象
研究人员开发了一个理论框架来解释机器学习中的“Grokking”现象,即模型以不同速率拟合训练数据和学习可泛化规则。他们提出了“两个训练时钟”的概念,以区分分类损失的快速下降和模型内部表征的缓慢简化。该理论最初在深度线性网络中得到验证,然后扩展到解释ReLU MLP中类似的行为,表明存在一个两阶段学习过程,其中分类器首先适应,然后进行表征优化。
-
大步长梯度下降重新分配了深度网络中的信号
研究人员已经证明,具有大步长的离散梯度下降与多通路深度线性网络中的梯度流会产生不同的结果。虽然梯度流预测会出现“赢家通吃”的情况,即特征集中在单个通路中,但本研究表明,大步长梯度下降会导致信号在通路之间重新分配。这种在稳定边缘发生的再平衡阶段,有利于共享表示而不是持续的单通路主导,从而阐明了网络深度如何影响通路竞争。