Silu Activation Function
PulseAugur coverage of Silu Activation Function — every cluster mentioning Silu Activation Function across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新方法从语言模型中提取无偏见的GLU块
研究人员开发了一种新的密码分析方法,用于从语言模型中提取无偏见的门控线性单元(GLU)前馈块。该技术使用有限差分曲率和配对观测,可以恢复以前无法通过提取方法获得的特定块类型。虽然在高精度测试中,从Qwen、Llama和Gemma等模型中恢复孤立块的成功率中位误差低于百分之一,但该方法尚未解决从最终模型输出中推导出必要的内部块响应的挑战。
-
llama.cpp 发布包含服务器改进和性能优化 · 跟踪 8 个来源
llama.cpp 项目发布了多个更新,包括 b10331 版本,该版本通过正确报告隔离工作目录来改进服务器功能。其他近期版本,如 b10330 及更早版本,则侧重于 CUDA 操作的性能优化、SYCL 的错误修复以及跨 macOS、Linux、Android 和 Windows 等各种平台的通用系统兼容性。这些更新反映了 llama.cpp 库在高效本地 LLM 部署方面的持续开发和完善。
-
新的 Kazry 激活函数在神经网络测试中表现优于 SiLU
一种新的神经网络分段激活函数 Kazry 被引入。由 Katriel Fishel Tchursh 开发的 Kazry 在测试中表现优于 SiLU 激活函数。
-
新框架通过状态分析对深度神经网络进行经验性压缩
研究人员开发了一种通过分析其内部状态的可控性和可观测性来压缩深度神经网络的新颖方法。该框架将训练好的网络视为动力学系统,使用数据驱动的测试来估计隐藏状态内的冗余度。该方法成功地减小了MNIST和CIFAR-10数据集上网络的态阶,在状态和参数方面实现了显著压缩,同时在很大程度上保持了准确性并提高了推理速度。
-
提出 GELU 和其他激活函数的新结构化解释
研究人员提出了一种对 GELU、ReLU、SiLU/Swish 和 hard swish 等激活函数的新结构化解释。这项工作将 GELU 不仅仅视为随机门输出,而是通过高斯互补一阶损失函数来理解。这种视角可以推广到一系列阈值传输激活,为理解它们的行为提供了新的途径。在视觉和语言模型上的实验表明,校准或学习的统一阈值门可以与现有激活函数竞争或超越它们。
-
新的神经网络架构应对复杂的科学计算问题 · 跟踪 8 个来源
研究人员正在开发新颖的神经网络架构来求解复杂的偏微分方程 (PDE) 和建模动力学系统。这包括用于离子传输的面向结构的随机神经网络 (SO-RaNN),用于具有已知图结构的_时间序列_预测的_信息_神经_控制_微分方程 (INDEQS),以及用于高保真 PDE 解的_启动器-迭代器_神经算子 (SINO)。此外,还提出了正交正则化 (OrthoReg) 来通过防止组件之间的重叠来改进混合符号-神经模型,而其他工作则探索了现代神经网络架…
-
新框架使脉冲神经网络可用于大型语言模型
研究人员开发了一个新框架,使大型语言模型更能兼容神经形态硬件。该方法侧重于为Transformer中的非线性算子创建对脉冲友好的近似,这些算子通常对标准的脉冲神经元动力学具有挑战性。通过将这些非线性分解为重复的基本单元,并使用神经元群体的计算,该框架可以在最小的精度损失下近似Softmax和SiLU等常见非线性。
-
神经网络实现超快收敛,并用浮点运算表示复杂函数
两篇新的arXiv论文探讨了神经网络收敛和表示能力的理论方面。第一篇论文证明,在特定条件下,包括硬间隔场景,神经网络分类器可以为各种激活函数实现超快收敛速率。第二篇论文研究了浮点网络的表示能力,表明它们可以使用自动微分来近似函数值和梯度,即使在实际的激活函数和有限精度算术下也是如此。