Residual Connections
PulseAugur coverage of Residual Connections — every cluster mentioning Residual Connections across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Transformer 架构精确实现 k-means 聚类算法
一篇新的研究论文详细介绍了一种“k-means transformer”架构的创建,该架构可以精确执行 k-means 聚类的 Lloyd 算法。该研究从理论上证明并通过实证表明,像注意力块和残差连接这样的标准 transformer 机制可以实例化这种精确的算法例程。此外,研究表明该架构可以学习和泛化聚类任务,在某些情况下甚至优于传统的 Lloyd 算法,并且可以修改以实现软 k-means 和球形 k-means 等变体。
-
理解反向传播:神经网络中的链式法则
本文解释了链式法则的数学概念及其在反向传播中的关键作用,反向传播是用于训练人工智能神经网络的算法。文章演示了如何手动计算导数并通过微小的数值扰动进行验证,这是一种对基于梯度的学习至关重要的调试技术。解释涵盖了一个简单的两层网络,详细介绍了计算输出的前向传播和计算每个参数的梯度的后向传播,并强调了该过程对大型模型的效率。
-
深度网络中的最优学习率缩放取决于数据,研究发现
一篇新的研究笔记探讨了深度标量线性网络的动力学,证明最优学习率缩放依赖于数据。研究表明,在不同网络深度下,与数据无关的缩放规则会失效。然而,当应用最优的依赖于数据的缩放时,学习动力学变得与数据无关,并且仅弱依赖于深度,从而在包括无限深度在内的所有深度下实现一致的线性收敛速率。这种依赖于数据的效应在包含残差连接的网络中也得到了观察。
-
新框架分析神经网络中梯度下降的收敛性
研究人员开发了一个新框架来分析神经网络中梯度下降的收敛性,该框架超越了传统的神经切线核(NTK)理论。该框架适用于广泛的架构,包括预归一化的多层Transformer,并证明在温和的假设和特定的初始化下,梯度下降可以收敛到一个稳定点。该分析沿梯度下降轨迹建立了Lipschitz平滑性,并揭示学习率缩放取决于网络深度和瓶颈维度而非宽度,这对残差连接和函数组合具有影响。
-
超越注意力投影的线性:非线性查询的论证
研究人员正在探索 Transformer 注意力机制背后的基本原理,新论文分析了其梯度流结构和动态。一项研究将注意力解释为单位球面上的梯度流,识别影响多头设置中 token 聚类和稳定性的因素。另一篇论文研究了用于复杂性控制的关键训练窗口,确定 Transformer 何时优先考虑推理而非记忆。此外,研究还揭示了深度神经网络中几何连续性的起源,将其归因于残差连接和对称性破坏的非线性,并考察了“注意力汇聚”现象的结构原因。