Neural tangent kernel
PulseAugur coverage of Neural tangent kernel — every cluster mentioning Neural tangent kernel across labs, papers, and developer communities, ranked by signal.
- 2026-05-13 research_milestone Publication of a paper introducing a force-aware Neural Tangent Kernel for active learning of MLIPs. 来源
2 天有情绪数据
-
分析了分岔附近循环神经网络的学习动力学
一篇新的研究论文探讨了循环神经网络(RNNs)在接近临界过渡点(称为分岔)时的学习动力学。该研究利用全局经验神经切线核(GeNTK)证明,学习几何被放大并变得各向异性,集中于特定的低秩通道。这一理论框架通过高维RNNs和多任务LeakyRNN的实验得到验证,显示GeNTK放大与突然的损失变化、子任务干扰以及内部动力学变化之间存在相关性。
-
新理论将相关性传播与深度学习中的神经切线核联系起来
研究人员在深度神经网络中的相关性传播与神经切线核(NTK)之间建立了理论联系。通过结合均值场理论和随机矩阵理论,他们证明了相关性传播到无限深度仅在权重-偏差方差平面上的临界点才可能发生。在该临界点,端到端雅可比行列式随着深度的增加而代数式地消失,导致NTK与输出相关性成正比。研究还表明,与高斯初始化相比,正交初始化能更好地控制有限宽度、有限深度的网络的渐近动力学。
-
新工具解释电力系统动力学中的神经网络训练
研究人员开发了新的分析工具来解释电力系统动力学中使用的机器学习代理模型的训练性能。通过借鉴电力系统的小信号特征值分析,神经网络切线核(NTK)方法提供了学习性能的模态解释。该方法将电力系统模型中的物理刚度与神经网络训练过程中的优化刚度联系起来,从而能够开发自适应损失加权策略,并解释为什么某些神经网络架构(如ActNet)的性能优于标准神经网络。这些工具旨在超越试错式设计,为工程应用中创建更可靠的机器学习代理提供物理感知洞察。
-
弱相关性原理解释了基于梯度的学习系统中的线性化
一篇新发表在arXiv上的论文探讨了弱相关性原理是观察到的基于梯度的学习系统线性化的根本原因。研究表明,深度学习模型中看到的简化动力学,尤其是在无限极限下,可以归因于假设函数相对于参数的一阶和高阶导数之间的弱相关性。这一见解在宽神经网络中得到了证明,并导致了在随机梯度下降训练期间偏离线性的推导界限。
-
新框架通过信息传播路径增强物理信息神经网络
研究人员开发了一种新的物理信息神经网络(PINNs)框架,解决了这些网络在处理偏微分方程方面的局限性。提出的多维度训练优先级加权系统考虑了信息的物理传播,优先从源区域到依赖区域在空间、时间、边界维度上进行学习。该方法通过神经切线核动力学进行分析,旨在通过使网络的学习过程与物理原理保持一致来提高训练稳定性和预测精度,在不改变网络架构的情况下,在基准案例上持续改进。
-
新的微分神经切线核框架推进了PINN分析
研究人员引入了微分神经切线核(DNTK)作为分析物理信息神经网络(PINN)的新理论框架。该框架在各种激活函数和线性微分算符下,为浅层和深层神经网络的无限宽度DNTK的正性奠定了基础。这些发现对于推进PINN的基于梯度的训练算法的分析至关重要,特别是在求解偏微分方程方面。
-
研究发现:神经网络在组合任务上表现优于NTK限制
一项新的研究论文探讨了训练过的神经网络与其神经切线核(NTK)限制之间的性能差距,特别是在具有组合结构的任务上。该研究在傅里叶复杂度(控制NTK核回归)和架构复杂度(与深度ReLU网络的学习能力相关)之间引入了一个二分法。研究结果表明,当这些复杂度发散时,NTK估计器可能比标准网络存在指数级的次优性,这在迭代锯齿波和超立方稀疏奇偶校验模型等特定模型上得到了证明。
-
论文分析基于分数的生成模型的SGD收敛性
研究人员发表了一篇论文,分析了基于分数的生成模型(SGMs)训练的优化动力学。该研究侧重于随机梯度下降(SGD),并为一般的分数参数化提供了收敛速率,同时考虑了权重因子。此外,对于过参数化的双层ReLU网络,该论文使用神经切线核(Neural Tangent Kernel)分析来确定SGD轨迹上的分数近似误差界限。研究结果为重排因子在SGMs分数近似中的影响提供了理论指导。
-
新研究详解基于分数的生成模型SGD收敛性
研究人员发表了一篇论文,详细介绍了随机梯度下降(SGD)应用于基于分数的生成模型(SGMs)时的非渐近收敛性。该研究为训练SGMs的SGD提供了理论保证,解决了优化动力学问题,而这方面的研究比其采样过程的研究要少。该工作为一般分数参数化建立了收敛率,并使用神经切线核分析了过参数化网络,为实际中的权重选择提供了指导。
-
新的变分表述简化了神经网络训练
研究人员提出了一种新颖的浅层神经网络变分表述,将离散训练问题视为连续变分代理。该方法利用加权 Sobolev 空间中的 $\lambda$-凸泛函,证明了全局适定性和稳定性以及出乎意料的正则性。与现有方法不同,这种表述提供了对椭圆正则性和凸分析的直接访问,通过单个线性系统求解最优参数密度,从而完全绕过了迭代优化。该工作还建立了明确的泛化误差控制,并证明了有限宽度网络以 $O(1/N)$ 的速率达到连续体最优值,弥合了神经切线核和特征学…
-
新框架分析用于PDF拟合的神经网络训练
研究人员开发了一个使用神经切线核(NTK)的理论框架,用于分析用于部分子分布函数(PDF)拟合的神经网络的训练动力学。该方法提供了神经网络在训练过程中演变的解析描述,阐明了架构和实验数据的影响。它还提供了一种定量方法来理解不确定性如何从数据传播到拟合函数,并作为拟合方法学的诊断工具。
-
新框架分析神经网络中梯度下降的收敛性
研究人员开发了一个新框架来分析神经网络中梯度下降的收敛性,该框架超越了传统的神经切线核(NTK)理论。该框架适用于广泛的架构,包括预归一化的多层Transformer,并证明在温和的假设和特定的初始化下,梯度下降可以收敛到一个稳定点。该分析沿梯度下降轨迹建立了Lipschitz平滑性,并揭示学习率缩放取决于网络深度和瓶颈维度而非宽度,这对残差连接和函数组合具有影响。
-
新研究探究 AI 模型中的灾难性遗忘 · 追踪 4 个来源
三篇新研究论文探讨了持续学习系统中灾难性遗忘的现象,特别是在大型语言模型中。第一篇论文引入了一个受控框架来研究遗忘机制,提出表示强度和特征稀疏性起着关键作用,而不仅仅是叠加。第二篇和第三篇论文(似乎是相同的)在神经切线核(NTK)框架下提供了一个函数空间理论,提出遗忘是低秩的,并集中在特定的输出空间方向。第四篇论文对二十个最先进模型进行了机制分析,识别了脆弱的神经回路,并引入了一种名为低秩电路投影(LRCP)的新干预措施来减轻遗忘。
-
新理论将神经网络集成与核反应模型联系起来
一篇新论文提出了一个理论框架,用于理解开放系统中的神经网络集成,并将其与核反应理论进行类比。研究表明,现有的集成理论主要处理封闭系统,忽略了信息可以不可逆地流出的关键“开放”情况。该论文引入了一种使用分布矩和高斯代数的数学方法来分析这个开放系统,发现虽然可以跟踪守恒通量,但最有用的不确定性在于模型“封闭”的一半。
-
新方法分析非线性最小二乘模型中的泛化能力
研究人员开发了一种新方法来理解非线性最小二乘模型如何泛化。他们的方法利用平均算法稳定性来推导局部最小化器的误差界限。这些界限与训练参数处梯度模型的几何形状相关,提供了依赖于学习到的几何形状而非仅仅参数数量的见解。
-
深度神经网络实现最优泛化率
两篇新提交至arXiv的论文分析了深度神经网络中梯度下降方法的泛化性能。研究为使用GD和SGD训练的深度ReLU网络中的超额总体风险建立了minimax最优率,前提是网络宽度与深度和样本量成比例缩放。这些发现表明,具有足够宽度的深度神经网络可以实现与核方法相当的泛化率。
-
NTK理论已扩展到神经网络分类
研究人员已将神经切线核(NTK)理论扩展到分类任务,而此前该理论仅限于回归损失。他们确定了在交叉熵损失的训练过程中,宽神经网络保持恒定NTK的条件,包括参数空间正则化或非退化目标。这使得训练过程可以通过线性化模型进行精确近似,通过NTK提供明确的解的表征,并将模型不确定性与贝叶斯方法联系起来。
-
新理论解释神经网络训练速度
研究人员开发了一个新的理论框架,以更好地理解过度参数化神经网络的优化动态。该框架以神经切线核(NTK)为中心,引入了标签-NTK对齐和残差-NTK对齐等概念,以解释数据标签如何与NTK的光谱特性相互作用。这项工作提供了更严格的收敛性和泛化界限,更接近MLP和CNN等模型中观察到的实际训练速度。
-
新的优化技术提高了复杂物理神经网络的精度
研究人员开发了一种名为 SOAP+GN 的新优化技术,以提高物理信息神经网络 (PINNs) 在处理复杂耦合多物理场系统时的精度。该方法解决了 PINN 精度随着方程间耦合增强而下降的已知问题。通过采用 Kronecker 预处理优化和逆梯度范数损失平衡,SOAP+GN 在大量实验中表现出鲁棒的精度,即使在以前标准优化方法(如 Adam+GN)不堪重负的挑战性二维系统中也是如此。
-
新方法增强神经网络不确定性估计
研究人员开发了一种新方法来改进用于估计神经网络不确定性的贝叶斯最后一层(BLLs)。他们的方法利用神经切线核(NTK)特征的投影来考虑整个网络的可变性,解决了标准BLLs中出现的认知不确定性低估问题。该方法可证明具有更大或相等的后验方差,并包含一个子采样方案以降低计算成本。在各种数据集上的实证测试表明,与现有方法相比,校准和不确定性估计得到了改善。