two-layer neural networks
PulseAugur coverage of two-layer neural networks — every cluster mentioning two-layer neural networks across labs, papers, and developer communities, ranked by signal.
-
新理论解释了部分训练神经网络的训练动力学
研究人员开发了一个新的理论框架,以理解部分训练的三层神经网络的训练动力学。通过将平均场理论扩展到函数空间,他们证明了极限模型遵循具有时变核的函数梯度流。这种方法证明了训练损失的线性收敛,并展示了跨不同缩放机制下的特征学习。
-
面向两层神经网络的数据集蒸馏理论解释
研究人员从理论上分析了应用于两层神经网络基于梯度的训练的数据集蒸馏算法。该研究聚焦于一种称为多索引模型的非线性任务结构,证明了问题的低维结构被有效地编码到生成的蒸馏数据中。这种合成数据可以重现具有高泛化能力的模型,所需的内存复杂度为 $\tilde{\Theta}$$(r^2d+L)$,其中 $d$ 和 $r$ 是任务的输入维度和内在维度。
-
新的均场模型通过基于共识的优化增强了神经网络训练
研究人员开发了一种用于使用基于共识的优化(CBO)训练两层神经网络的均场模型。该方法与Adam结合使用时,比单独使用CBO收敛更快。研究还表明,CBO可以适应多任务学习,并减少内存开销。CBO和神经网络的均场模型均已通过数值计算得到验证。
-
神经网络损失 Plateau 的几何刻画
研究人员开发了一个几何框架来理解两层神经网络损失景观中的平稳 Plateau。他们的工作对这些平稳点进行了分类,根据特定神经元的曲率特性区分局部最小值和鞍点。研究结果揭示了通过神经元复制扩展网络宽度如何影响这些点的性质,为模型扩展和重新参数化提供了见解。
-
AI对齐研究探索弱到强泛化机制
研究人员对弱到强泛化这一对齐先进AI系统的理论机制进行了分析。他们的工作聚焦于具有两层神经网络的奖励模型学习,并展示了强模型如何在不发生灾难性遗忘的情况下,通过提取其预训练知识来高效学习新任务。该方法证明了强模型通过此训练过程获得了目标特征方向,并保留了其通用能力。