Gelu
PulseAugur coverage of Gelu — every cluster mentioning Gelu across labs, papers, and developer communities, ranked by signal.
- instance of SwiGLU 90%
- instance of Silu Activation Function 70%
- instance of Swish 70%
- used by Softmax 70%
- competes with Swish 70%
- used by Swish 70%
- instance of hyperbolic tangent 70%
- used by multilayer perceptron 70%
- instance of sigmoid function 70%
- competes with Silu Activation Function 60%
- affiliated with Swish 50%
- used by SwiGLU 50%
3 天有情绪数据
-
新方法从语言模型中提取无偏见的GLU块
研究人员开发了一种新的密码分析方法,用于从语言模型中提取无偏见的门控线性单元(GLU)前馈块。该技术使用有限差分曲率和配对观测,可以恢复以前无法通过提取方法获得的特定块类型。虽然在高精度测试中,从Qwen、Llama和Gemma等模型中恢复孤立块的成功率中位误差低于百分之一,但该方法尚未解决从最终模型输出中推导出必要的内部块响应的挑战。
-
llama.cpp 发布包含服务器改进和性能优化 · 跟踪 8 个来源
llama.cpp 项目发布了多个更新,包括 b10331 版本,该版本通过正确报告隔离工作目录来改进服务器功能。其他近期版本,如 b10330 及更早版本,则侧重于 CUDA 操作的性能优化、SYCL 的错误修复以及跨 macOS、Linux、Android 和 Windows 等各种平台的通用系统兼容性。这些更新反映了 llama.cpp 库在高效本地 LLM 部署方面的持续开发和完善。
-
新型轻量级检测 Transformer 实现全整型推理
研究人员开发了 I-LW-DETR,这是一种新型轻量级检测 Transformer,可实现全整型推理。这对于在 NPU 和微控制器上部署此类模型来说是一个重大进展,因为这些设备传统上难以处理 Transformer 中常见的浮点运算。该系统包含一个保持比例的分割卷积、一个依赖符号的 GELU 近似(SD-ShiftGELU)和一个约束的 Shiftmax 函数,以确保包括非线性在内的所有运算都使用整数算术执行。这种方法使得模型尺寸减小…
-
FFNet推出用于视觉任务的高效卷积混合器
研究人员推出FFNet,这是一种新颖的卷积混合器架构,旨在提高计算机视觉任务的效率。FFNet将Transformer的前馈网络(FFN)组件重新解释为内存网络,并侧重于查询-键-值框架。通过用大核卷积替换自注意力并利用GELU激活,FFNet旨在比现有方法更有效地捕获空间模式。提出的MetaMixer架构概括了这种方法,为混合器设计提供了一个灵活的框架。
-
Tessera系统为AI工作负载解锁异构GPU
一个名为Tessera的新系统已被开发出来,以提高在异构GPU集群上运行大型AI模型的性能和成本效益。与之前在粗粒度级别运行的方法不同,Tessera在内核级别分解工作负载,认识到不同的内核具有不同的资源需求。这种方法可以更精确地将计算与硬件能力对齐,从而在服务吞吐量和成本效益方面取得显著改进。Tessera还展示了对新模型架构的泛化能力,甚至可以在更低的成本下超越同构GPU设置。
-
新方法训练 Transformer 以增强可读性和可编辑性
研究人员开发了一种方法,通过将每通道方差下限作为损失指标来训练更具可读性的 Transformer 模型。这种方法鼓励模型使用清晰、上下文相关的检测器,而不是将算子折叠成常数。由此产生的 Transformer 表现出显著更高的可读性,其前馈和注意力通道的大部分充当检测器。这种增强的可读性允许对模型的内部工作进行更局部化和有针对性的编辑,从而使概念能够由单个、可手术编辑的单元表示。
-
新分析统一了深度神经网络的梯度下降收敛性
研究人员开发了一种统一的收敛性分析方法,适用于训练深度神经网络的各种梯度下降优化方法。这种新分析适用于广泛的优化器,包括 Adam、Momentum 和 RMSprop,当与 Softplus 和 GeLU 等解析激活函数一起使用时。该研究利用 Kurdyka-Łojasiewicz 不等式证明了收敛到临界点,为理解 AI 优化算法,特别是 Adam 优化器,做出了新的贡献。
-
提出 GELU 和其他激活函数的新结构化解释
研究人员提出了一种对 GELU、ReLU、SiLU/Swish 和 hard swish 等激活函数的新结构化解释。这项工作将 GELU 不仅仅视为随机门输出,而是通过高斯互补一阶损失函数来理解。这种视角可以推广到一系列阈值传输激活,为理解它们的行为提供了新的途径。在视觉和语言模型上的实验表明,校准或学习的统一阈值门可以与现有激活函数竞争或超越它们。
-
新的NC-FFN架构增强了Transformer的可解释性和效率
研究人员开发了一种新颖的、参数中性的Transformer前馈网络替代方案,称为NC-FFN,它利用显式的模糊集运算。这种新架构在N位奇偶校验任务上表现出强大的参数效率,并在OpenWebText等更大模型的困惑度上与GELU基线相匹配。NC-FFN还提高了语法许可和量词理解能力,使得前馈层的计算更加清晰和可解释。
-
DREG正则化方法在深度学习中展现出卓越的准确性
研究人员推出了一种名为DREG的逐层雅可比正则化技术,该技术可作为神经网络的通用惩罚。在一项大规模实证研究中,DREG与其他正则化器相比,展现出卓越的准确性,尤其是在数据稀疏和使用Transformer架构中常见的GELU激活函数时。该方法持续优于基线,并在噪声鲁棒性方面排名第二,表明其作为深度学习模型的即插即用解决方案的潜力。
-
新研究深入探讨 Transformer 的能耗、学到的线性以及训练动态
近期研究探索了 Transformer 模型的复杂性,重点关注其能耗、内部线性特性和训练动态。其中一篇论文引入了一个缩放模型,用于预测微调期间的能耗,该模型受 Roofline 模型启发,并考虑了并行效应。另一项研究调查了 Transformer 前馈块的线性,揭示了这种特性是学到的而非架构性的,并且在不同层之间存在显著差异。第三篇论文通过连续深度均场控制的视角分析了 Transformer 层,将交叉熵训练与最优控制问题联系起来。此…
-
新的IGLU激活函数提供了改进的梯度流
研究人员推出IGLU,一种新颖的深度神经网络参数化激活函数,旨在改善梯度流和优化稳定性。IGLU源自半正态分布下GELU门的混合体,通过单个参数在类似恒等和类似ReLU的行为之间提供连续插值。其重尾柯西门确保所有有限输入的梯度非零,增强了对梯度消失的鲁棒性。一种高效的近似方法IGLU-Approx仅使用ReLU运算,在保持视觉和语言数据集上具有竞争力的性能的同时,降低了计算成本。
-
新的神经网络架构应对复杂的科学计算问题 · 跟踪 8 个来源
研究人员正在开发新颖的神经网络架构来求解复杂的偏微分方程 (PDE) 和建模动力学系统。这包括用于离子传输的面向结构的随机神经网络 (SO-RaNN),用于具有已知图结构的_时间序列_预测的_信息_神经_控制_微分方程 (INDEQS),以及用于高保真 PDE 解的_启动器-迭代器_神经算子 (SINO)。此外,还提出了正交正则化 (OrthoReg) 来通过防止组件之间的重叠来改进混合符号-神经模型,而其他工作则探索了现代神经网络架…
-
Adam 与 SGD:研究发现没有单一因素能解释性能差距
一项新的研究论文探讨了 Adam 和 SGD 优化算法之间的性能差距,发现没有单一因素能持续解释这种差异。研究表明,这种差距源于数据和模型架构之间复杂的相互作用,而非单一原因。研究人员观察到一个交叉批量大小,随着批量大小的增加,Adam 和 SGD 之间的优势会发生转移,这一现象被他们的理论模型所捕捉。
-
Apple M4 Max GPU 的张量计算路径被模拟,而非加速
研究人员逆向工程了 Apple M4 Max GPU 上的 Metal 4.1 张量计算路径,发现 fp8 matmul2d 操作是模拟的,而非硬件加速。这意味着该操作在 GPU 的着色器核心上运行,至少以 fp32 精度累积,并且不使用专用的矩阵数据路径或 Apple Neural Engine。这些发现详细记录在一篇题为“Rigel”的论文中,通过实证表征和微基准测试实现,并开发了一个融合内核,其性能比分解路径高出 12.9%。
-
新算法为非线性人工智能模型提供鲁棒学习能力
研究人员开发了一种新颖的算法,即使在面对重尾噪声和对抗性破坏时,也能鲁棒地学习高斯单索引模型(SIMs)。该新方法首次为广泛的非线性SIMs提供了鲁棒恢复保证,包括那些具有非单调链接函数(如GeLU和Swish)的模型,这些模型在现代神经网络架构中很常见。该算法围绕真实参数建立了一个与维度无关的凸盆地,通过谱初始化和后续的鲁棒梯度下降实现高效恢复,以近线性时间复杂度实现了O(σ√ε)的估计误差。
-
论文分析浮点神经网络的表达能力
研究人员发表了一篇论文,探讨了使用浮点算术运算的神经网络的表达能力,超越了假设精确实数的理论模型。该研究引入了一个框架来分析任意归约顺序和不精确激活实现如何影响网络的函数表示能力。这项工作确立了浮点神经网络能够实现通用表示的条件,将先前的发现扩展到更广泛的实际激活函数。
-
新的MoA FFN设计增强了LLM的表现力和可扩展性
研究人员为大型语言模型(LLM)引入了一种新颖的前馈网络(FFN)设计,称为激活混合(Mixture of Activations, MoA)。MoA利用了自适应激活混合,允许基于轻量级的、依赖输入的门控机制,将不同的激活函数应用于不同的token。这种方法理论上比固定的激活函数FFN和可学习激活函数(LA)具有更强的表现力。在从0.12B到2B参数的模型上进行的实证评估表明,MoA以最小的开销持续实现更低的终端损失和更好的可扩展性。
-
激活函数使神经网络能够模拟复杂的非线性模式
神经网络依赖激活函数来引入非线性,使其能够模拟超越简单线性关系的复杂模式。没有这些函数,即使是深度网络也会坍缩成等效的线性模型,严重限制其能力。激活函数的演变,从早期的Sigmoid到ReLU和GELU,反映了深度学习的进步,每种类型都解决了特定的优化挑战,并为AI发展的不同时代提供了动力。
-
残差连接通过绕过层来支持更深层的LLM训练
本文解释了残差连接,这是Transformer架构中的一个关键组成部分,对于训练像大型语言模型(LLMs)这样的深度神经网络至关重要。残差连接通过提供梯度的替代路径来帮助克服梯度消失问题,使模型能够学习更复杂的模式。这项技术对于自然语言处理(NLP)任务(如翻译、摘要和文本生成)的进步至关重要。