rectifier
PulseAugur coverage of rectifier — every cluster mentioning rectifier across labs, papers, and developer communities, ranked by signal.
- instance of DagsHub 90%
- instance of alphaXiv 90%
- instance of Gelu 70%
- instance of Gotit.pub 70%
- instance of sigmoid function 70%
- instance of hyperbolic tangent 70%
- used by hyperbolic tangent 70%
- instance of multilayer perceptron 70%
- instance of LeakyReLU 70%
- instance of Swish 70%
- used by sigmoid function 60%
- instance of Elu 60%
7 天有情绪数据
-
新的深度学习架构显示出二次深度依赖性
研究人员开发了一种名为 Parhi--Nowak deep-RBV^2 的新深度学习架构,该架构在回归任务中表现出对深度的二次依赖性。该架构的参数随深度 L、宽度 w 和变分预算 A 缩放,表明深度的影响是内在的。该研究提供了最小最大风险的下界和上界,表明模型深度与其泛化能力之间存在显著关系。
-
SAR数据压缩与去噪框架部署在FPGA上
研究人员已成功将联合合成孔径雷达(SAR)去噪与数据压缩框架部署到嵌入式FPGA平台。这项工作解决了未来SAR任务中对板载数据缩减的关键需求,以实现近乎实时的地球观测。该研究调整了模型拓扑以满足星载系统的约束,并评估了在不同精度和平台(包括CPU、GPU和FPGA)上的性能。主要发现表明,ReLU激活函数比用于自然图像的激活函数更适合SAR图像,并且FPGA为这项任务提供了最高效的解决方案。
-
新研究探讨宽神经网络中梯度流的收敛性
研究人员发表了一篇论文,探讨了宽浅神经网络模型中梯度流的全局收敛性,该研究超越了先前研究的齐次非线性。该研究建立在先前工作的基础上,证明了对于包括多头注意力层和向量输出权重在内的更广泛模型类别,非全局最小值在均值场梯度流动力学中是不稳定的。研究结果取决于均值场梯度流在 W2 中收敛,在这种情况下,极限必须是全局最小值。论文提出了具有线性增长和渐近正一齐次非线性的新构造,以及在亚高斯初始化下均值场动力学的稳定性估计。
-
新的HSMLA方法提高了视觉Transformer在密集预测任务中的效率
研究人员推出了一种名为HSMLA(分层Softmax多尺度线性注意力)的新方法,旨在提高视觉Transformer在处理高分辨率密集预测任务时的效率。该方法结合了用于全局上下文的线性注意力和用于局部特征和多尺度Token表示的选择性softmax细化。HSMLA在多种任务中展示了显著的加速效果,包括CT器官分割和病理WSI分析,推理时间速度提升高达4.2倍。
-
输入凸神经网络在优化方面优于前馈神经网络
研究人员引入了输入凸神经网络(ICNNs)作为传统前馈神经网络(FNNs)在数学优化问题中的更优替代方案。ICNNs 因其凸结构提供了计算优势,能够实现更紧密的线性规划松弛,并可能消除积分间隙。虽然具有 ReLU 激活函数的前馈神经网络可以重新表述为混合整数规划问题,但 ICNNs 通过上图表示允许进行基于 LP 的重新表述。在人道主义粮食援助、油井选址和葡萄酒调配等领域的案例研究表明,ICNNs 在匹配 FNN 准确性的同时,提高了…
-
用于椭圆谱方程的神经网络逼近新理论
研究人员为使用线性化ReLU^k神经网络逼近椭圆谱方程开发了一个严格的理论框架。该方法在配置点上采用离散残差最小二乘逼近来估计解。该理论建立了逼近界和高概率残差估计,其关键分析组成部分是线性化ReLU^k网络空间的Bernstein不等式。
-
新方法从语言模型中提取无偏见的GLU块
研究人员开发了一种新的密码分析方法,用于从语言模型中提取无偏见的门控线性单元(GLU)前馈块。该技术使用有限差分曲率和配对观测,可以恢复以前无法通过提取方法获得的特定块类型。虽然在高精度测试中,从Qwen、Llama和Gemma等模型中恢复孤立块的成功率中位误差低于百分之一,但该方法尚未解决从最终模型输出中推导出必要的内部块响应的挑战。
-
理解反向传播:神经网络中的链式法则
本文解释了链式法则的数学概念及其在反向传播中的关键作用,反向传播是用于训练人工智能神经网络的算法。文章演示了如何手动计算导数并通过微小的数值扰动进行验证,这是一种对基于梯度的学习至关重要的调试技术。解释涵盖了一个简单的两层网络,详细介绍了计算输出的前向传播和计算每个参数的梯度的后向传播,并强调了该过程对大型模型的效率。
-
神经网络:令牌ID如何变成矩阵乘法
本文解释了自然语言处理中使用的神经网络的基本计算。它详细说明了单词如何首先被转换为数字令牌ID,然后由网络层进行处理。每一层都执行带有学习权重的矩阵乘法,然后进行ReLU等非线性激活函数,将输入向量转换为新的表示。文章强调了GPU如何加速这些可并行化的矩阵运算,并将其与循环神经网络(RNN)的顺序计算进行对比,解释了Transformer为何能更有效地扩展。
-
新的反例挑战了单神经元AI训练中的傅里叶对齐
研究人员提出了一个单神经元模加傅里叶对齐假设的反例。该反例表明,一个ReLU神经元可能会变得不活跃,并保持在极限状态,其傅里叶能量分布在所有非零实频率上。在高斯初始化下,这种失败以正概率发生,并且对于Clarke轨迹和ReLU的光滑近似,使用固定步长梯度下降也可能发生。这一发现表明,在训练单个神经元进行模加时,单频率对齐并非必然结果。
-
新研究对单神经元AI模型的傅里叶对齐提出挑战
研究人员提出了一个单神经元模加傅里叶对齐假说的反例。该研究展示了一种情况,其中一个ReLU神经元在初始激活后变得不活跃,并在傅里叶能量均匀分布在频率类别上的极限处冻结。这种现象在Gaussian初始化下以正概率发生,并且可以扩展到Clarke轨迹,这表明在训练单个神经元进行模加时,单频率对齐并非普遍结果。
-
为 ReLU NTK Gram 矩阵建立了新的界限
研究人员为 ReLU 神经网络切线核 (NTK) Gram 矩阵的最小特征值建立了严格的最坏情况界限。该研究关注 d 维空间中的单位向量,并在标准高斯方向上对成对门控内积进行平均。研究结果为最小特征值提供了 $\Omega(\Delta_\pm/\sqrt{\log n})$ 的通用、无量纲的下界,其中 $\Delta_\pm$ 表示向量的投影分离度。该界限被证明是严格的,并为最坏情况构建了匹配的上界。
-
新算法可证明地学习多头注意力参数
研究人员开发了一种学习多头softmax注意力的新方法,这是Transformer模型中的一个关键组成部分。这种新算法可以在不需要先验知识正交子空间的情况下恢复这些注意力头的参数,而这是先前方法的局限性。该方法通过合并具有相同权重的头并对其对应的数值进行求和来实现,从而有效地创建了一个规范表示。该算法通过查询任意token序列并分析由此产生的标量输出来实现这一点,使用特定数量的查询来高概率地重建注意力头参数。
-
新方法使用高斯平滑处理量化神经网络
研究人员开发了一种使用高斯平均作为量化神经网络平滑近似的方法。该技术在有界局部振荡下应用时,为原始函数与其平滑版本之间的差异提供了依赖于维度的界限。该研究还为ReLU和符号函数等常见激活函数提供了闭式高斯平均,并展示了它们在高维二元感知器模型上的应用。
-
新研究推进神经网络训练可处理性前沿
研究人员发表了一篇新论文,详细介绍了在理解神经网络训练的计算复杂性方面取得的进展。该研究为具有线性激活函数和ReLU激活函数的网络的训练引入了新的算法上限,拓展了可处理性的边界。具体而言,它确立了具有隐藏神经元出度为1的ReLU网络的(多项式时间)可处理性,并基于数据吞吐量条件识别了一类新的多项式时间可解的线性激活网络。
-
ReLU 网络可以用更少的层表示最大值函数
研究人员已经证明,对于任何 n 高达 10 的情况,n 个实数的最大值都可以用具有两个隐藏层的 ReLU 网络精确表示。这是通过将问题转化为精确的有理线性代数问题,并通过计算求解必要的抵消来实现的。该研究还表明,对于 n > 10 的情况,最大值可以用比先前认为的更少的隐藏层来表示,从而改进了先前的界限。
-
研究论文分析两层 ReLU 网络的损失景观
一篇新发表在 arXiv 上的研究论文探讨了两层 ReLU 网络的损失景观,重点关注宽度依赖的超参数和 L2 正则化的影响。研究推导出了全局最小值可以坍缩为零解的条件,发现 AdamW 优化器可以防止这种坍缩,而 SGD 则不能。此外,对于具有单一输入维度的网络,提出了最优参数的解析解,表明 L2 正则化的降维效果随着网络宽度的增加而增强。
-
随机噪声并不能简化精确 ReLU 网络验证
一篇新的研究论文探讨了在对抗性平滑下验证整流线性单元 (ReLU) 神经网络的复杂性。研究表明,添加随机参数噪声、裁剪和舍入网络权重并不能简化精确验证过程。研究结果表明,假设 NP 不是 BPP 的子集,即使对于某些网络配置存在固定的噪声水平,也不存在所有基本实例的高效验证器。
-
研究人员证明了两层神经网络的鲁棒性定律
研究人员证明了具有任意权重的两层神经网络的“鲁棒性定律”,解决了 Bubeck、Li 和 Nagaraj 的一个猜想。该证明适用于 ReLU 等连续分段线性激活函数,它表明在某个阈值以下拟合噪声数据需要特定的 Lipschitz 常数。这一发现很重要,因为它不需要对网络权重的规模进行限制,而这是先前相关证明中存在的局限性。
-
研究发现:神经网络在组合任务上表现优于NTK限制
一项新的研究论文探讨了训练过的神经网络与其神经切线核(NTK)限制之间的性能差距,特别是在具有组合结构的任务上。该研究在傅里叶复杂度(控制NTK核回归)和架构复杂度(与深度ReLU网络的学习能力相关)之间引入了一个二分法。研究结果表明,当这些复杂度发散时,NTK估计器可能比标准网络存在指数级的次优性,这在迭代锯齿波和超立方稀疏奇偶校验模型等特定模型上得到了证明。