SwiGLU
PulseAugur coverage of SwiGLU — every cluster mentioning SwiGLU across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新的TriPLU架构提高了小型语言模型的性能
研究人员开发了TriPLU,一种用于小型语言模型的新型前馈网络(FFN)架构。TriPLU用直接三线性乘积单元取代了标准门控FFN,该单元将三个学习到的特征投影相乘。在TinyStories数据集上的实验中,TriPLU与其他FFN变体相比,验证损失更低。研究表明,在特定的低计算条件下,直接乘积FFN可以提高小型模型的性能,但优化敏感性和缩放行为需要进一步研究。
-
新研究诊断出仅解码器Transformer中的秩崩溃问题
一篇新研究论文发布在arXiv上,详细介绍了一种用于理解后归一化解码器Transformer中秩崩溃的机制性诊断方法。该研究分析了这些模型中的因果注意力如何导致高相似度表示,以及为什么训练动态未能纠正这一点。研究提出了一个使用token相似度作为状态变量的两阶段分析,解释了初始化和后续训练动态如何导致梯度消失和模型崩溃。
-
研究发现 SwiGLU 的开放正尾对语言模型并非必需
研究人员调查了 SwiGLU 的开放正尾在仅解码器语言模型中的必要性。他们引入了 MemGLU 作为闭尾替代方案,并发现,在多次预训练运行中,MemGLU 在验证 NLL 方面表现几乎与 SwiGLU 一样好。尽管 SwiGLU 检查点对正尾抑制敏感,但机制诊断显示,尽管性能相似,两种模型在门控使用上存在差异。这些发现表明,语言模型会适应预训练期间提供的门控几何形状,这表明 SwiGLU 的开放正尾对于测试规模下的仅解码器语言模型 F…
-
UniMoMo框架压缩MoE推荐模型以加速推理
研究人员开发了UniMoMo,一个训练后压缩框架,旨在加速使用混合专家(MoE)层的推荐模型。该方法根据专家的功能相似性而非参数距离对专家进行分组,并使用无标签的校准数据来评估专家对推荐状态的响应相似度。UniMoMo还引入了一个层自适应保护机制,通过限制高流量专家的合并来防止性能下降。在Amazon Beauty、KuaiRec和TenRec等数据集上的实验表明,将MoE模型压缩到更少的专家数量可以显著提高推理速度,同时保持高质量的推荐效果。
-
乐高积木类比解析现代GPT架构及效率提升
本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。
-
llama.cpp 发布包含服务器改进和性能优化 · 跟踪 8 个来源
llama.cpp 项目发布了多个更新,包括 b10331 版本,该版本通过正确报告隔离工作目录来改进服务器功能。其他近期版本,如 b10330 及更早版本,则侧重于 CUDA 操作的性能优化、SYCL 的错误修复以及跨 macOS、Linux、Android 和 Windows 等各种平台的通用系统兼容性。这些更新反映了 llama.cpp 库在高效本地 LLM 部署方面的持续开发和完善。
-
新的Prox方法通过前馈网络激活稀疏性提高LLM效率
研究人员开发了一种名为Prox的新型无训练方法,通过稀疏化其前馈网络(FFNs)来提高大型语言模型(LLMs)的效率。Prox利用SwiGLU激活的中间状态作为通道选择信号,并对其进行近似以降低计算成本。这种方法可以在模型质量没有显著下降的情况下实现FFN的稀疏执行,在各种LLM上优于现有的无训练方法,并实现了显著的加速。
-
Kimi K3 揭示长上下文和代理任务的架构创新
Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…
-
新研究深入探究小语言模型中的真理表征
研究人员探索了小语言模型中真理表征的内部机制,该研究建立在先前识别出通用真理子空间的工作之上。他们的调查显示,这些真理子空间的维度依赖于模型的知识库,随着知识的减少或材料异质性的增加而变得更加弥散。研究还发现,虽然注意力层传播真理框架,但前馈网络则与之对抗,并且SwiGLU值流与真理衰减存在因果关系。此外,每个类别的真理轴形成一个语义签名的排列,该排列在不同的模型家族中收敛,表明存在一个知识门控律而非架构律。
-
新框架增强了机器从面部表情分析人类情感的能力
研究人员开发了一个新颖的情感行为分析框架,专注于提高机器从面部表情推断人类情绪状态的准确性。所提出的方法引入了因果监督,以确保注意力机制专注于真正具有预测性的面部区域,而不是虚假的相关性。它还结合了互协方差正则化和门控非线性SwiGLU变换,以增强特征表达能力并捕捉更细微的情感线索。该方法在第11届野外情感行为分析竞赛中取得了优异的成绩,在效价-唤醒度估计、表情识别和动作单元检测方面取得了具体分数。
-
Amplitude Gating 改进 LLM 结构化输出,无需重新训练
研究人员开发了一种名为 Amplitude Gating (AG) 的新方法,可在推理过程中改进大型语言模型的结构化输出,而无需重新训练。该技术可调节前馈网络 (FFN) 中的激活幅度,保留预训练权重。AG 在工具结构化任务上显示出特别的潜力,提高了 Qwen3.5-9B 和 Qwen3-8B 等模型的性能,在函数调用和 JSON 模式任务上取得了显著的提升。
-
新内核通过融合 SwiGLU 激活来提高大语言模型推理速度
研究人员开发了新的技术,通过在瓦片级别将 SwiGLU 激活函数直接融合到 GEMM 操作中,来加速大语言模型 (LLM) 的推理。这些方法使用为 NVIDIA H100 GPU 定制的 CUTLASS 内核实现,显著减少了中间张量物化的相关开销。在 Qwen 2.5 模型上的评估显示,与标准的 PyTorch 实现相比,速度提升高达 2.47 倍,实现了更高的峰值 BF16 利用率,并展示了优于 cuBLAS 等现有库的数值性能。
-
现代 LLM Transformer 块通过 RMSNorm、GQA 和 MoE 演进
大型语言模型 (LLM) 中的现代 Transformer 块已超越最初的 2017 年设计,以提高训练稳定性、上下文长度、推理效率和模型容量。关键的进步包括使用 RMSNorm 进行更简单、更稳定的归一化,使用分组查询注意力 (GQA) 和旋转位置嵌入 (RoPE) 来优化注意力机制,以及在前馈网络中使用 SwiGLU 或专家混合 (MoE) 来增强表达能力和容量。这些修改解决了关键的扩展挑战,使大规模 LLM 的开发和部署更加实用。
-
新的 QG-MIL 架构提高了医学影像分析的准确性
研究人员开发了 QG-MIL,这是一种新颖的门控 Transformer 聚合器,旨在提高医学影像中多实例学习 (MIL) 的稳定性和准确性。这种新架构通过引入基于 RMSNorm 的预归一化、每头 QK 归一化、细粒度注意力输出门控和 SwiGLU 前馈模块来解决过度自信和不稳定的预测问题。QG-MIL 在病理学和血液学六个基准测试中表现出色,平均比现有方法高出 6.1 个宏平均 F1 分数,并显示出更分布式的实例加权。
-
xFormers 库可在 GPU 上实现内存高效的 Transformer 模型
本教程演示了如何使用 xFormers 库在 GPU 上构建内存高效的 Transformer 模型。它涵盖了实现和比较内存高效注意力与标准注意力,分析了因果掩码、打包序列、分组查询注意力 (GQA) 和 ALiBi 位置偏差等技术。该指南还展示了如何将这些方法结合到一个可训练的 GPT 风格模型中,该模型利用 xFormers 注意力和 SwiGLU 前馈层进行自动混合精度训练。
-
新的神经网络架构应对复杂的科学计算问题 · 跟踪 8 个来源
研究人员正在开发新颖的神经网络架构来求解复杂的偏微分方程 (PDE) 和建模动力学系统。这包括用于离子传输的面向结构的随机神经网络 (SO-RaNN),用于具有已知图结构的_时间序列_预测的_信息_神经_控制_微分方程 (INDEQS),以及用于高保真 PDE 解的_启动器-迭代器_神经算子 (SINO)。此外,还提出了正交正则化 (OrthoReg) 来通过防止组件之间的重叠来改进混合符号-神经模型,而其他工作则探索了现代神经网络架…
-
AI研究需要纪律、基础知识和初学者心态
成为一名成功的AI研究员需要结合持续的努力和动手实践,这类似于一种冥想练习,即使没有即时的见解,奉献精神也是关键。在快速发展的领域中,专注于基本概念而不是转瞬即逝的趋势对于长期的职业发展至关重要。文章认为,真正的研究深度来自于探索现有基准之外的新颖能力,而在AI这样新兴的领域,初学者心态可能是有优势的。
-
新的MoA FFN设计增强了LLM的表现力和可扩展性
研究人员为大型语言模型(LLM)引入了一种新颖的前馈网络(FFN)设计,称为激活混合(Mixture of Activations, MoA)。MoA利用了自适应激活混合,允许基于轻量级的、依赖输入的门控机制,将不同的激活函数应用于不同的token。这种方法理论上比固定的激活函数FFN和可学习激活函数(LA)具有更强的表现力。在从0.12B到2B参数的模型上进行的实证评估表明,MoA以最小的开销持续实现更低的终端损失和更好的可扩展性。
-
Transformer大语言模型架构趋向标准化栈
对2017年至2025年间53个大语言模型的最新分析显示,Transformer架构正显著趋同。这一事实上的标准包括预归一化 (RMSNorm)、旋转位置嵌入 (RoPE)、MLP中的SwiGLU激活函数以及共享键值注意力机制 (MQA/GQA)。这种趋同归因于优化稳定性提高、每FLOP质量提升以及内核可用性和KV缓存经济性等实际考量。
-
IBM 发布 Granite 4.1 LLMs,支持 512K 上下文并采用 Apache 2.0 许可
IBM 发布了 Granite 4.1 系列大型语言模型,包含 3B、8B 和 30B 参数版本。这些模型通过包含将上下文窗口扩展到 512K 标记的五阶段预训练过程,在约 15 万亿个标记上进行了训练。进一步的优化包括在精选数据上进行监督微调和强化学习。值得注意的是,8B 指令模型取得了与更大的 Granite 4.0 MoE 模型相当的性能,并且所有 Granite 4.1 模型均根据 Apache 2.0 许可提供。