PulseAugur
中
实时 20:59:22
实体 SwiGLU

SwiGLU

PulseAugur coverage of SwiGLU — every cluster mentioning SwiGLU across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
23
90 天内 23
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 27 条
  1. TOOL · CL_286905 ·

    小型Transformer通过新的训练方法实现更高的算术准确性

    研究人员开发了一种方法,通过使用算法草稿板和分层课程来提高小型语言模型的算术推理能力。他们发现,正确的数据加载和语言预训练至关重要,而像RoPE和SwiGLU这样的现代架构组件可以提高性能。特定的逐位长除法草稿板显著提高了准确性,但由于加法复杂性,多位数乘法仍然具有挑战性。该研究还强调了在无缓冲训练期间未见操作数和灾难性遗忘的问题。

  2. TOOL · CL_284931 ·

    开发者用免费 GPU 从零开始构建了一个小型的 1.88 亿参数混合专家模型

    VisionQuantech 的创始人 Shivam Kumar 详细介绍了如何仅使用免费的 Nvidia T4 GPU 构建一个小型、拥有 1.88 亿参数的混合专家(MoE)语言模型的流程。他采用了一种名为 Main Researcher System v4 的方法,该方法涉及从现有研究中提取 MoE 原始概念和元模式,使用 TRIZ 原理解决矛盾,并利用组合引擎筛选潜在架构。由此产生的模型 DeepSeekMoE-tiny,在计…

  3. TOOL · CL_273656 ·

    新理论解释了损失平台期期间神经网络的学习

    研究人员开发了一个新的理论框架来理解神经网络如何学习,特别是在整体损失停滞不前的时期。该研究侧重于具有 ReLU 和 Leaky ReLU 激活的两层网络,证明即使在种群损失保持不变的情况下,网络也能学习到更具预测性的表示。研究结果提供了发生这种情况的数学条件,显示了在网络复杂度受到限制的情况下,对齐度的提高和均方误差的减少。

  4. TOOL · CL_250095 ·

    TokenPrint:开源3D调试器可视化LLM计算

    TokenPrint是一款新的开源3D可视化和调试工具,旨在使Transformer和LLM模型内部的计算更易于探索。该工具由Sudharsanselvaraj开发,允许用户逐层跟踪模型中的token,检查嵌入、注意力分数和投影等元素。它旨在提供对模型如何处理信息的更清晰理解,超越静态图表,提供计算过程的交互式空间表示。

  5. TOOL · CL_218188 ·

    TANGO模型引入了新颖的门控算子用于语言建模

    研究人员推出了一种新颖的语言建模架构TANGO,该架构通过非线性门控算子聚合令牌信息。该方法用单个跨令牌门控残差更新取代了标准的Transformer组件。其变体WANGO通过处理最近的窗口并使用旧数据的前缀统计信息,提供了线性复杂度。尽管TANGO的操作次数较高,但TANGO和WANGO在FineWeb-Edu、Lean和DeepMind Mathematics等基准测试上的表现均优于其他模型。

  6. TOOL · CL_216032 ·

    新的TriPLU架构提高了小型语言模型的性能

    研究人员开发了TriPLU,一种用于小型语言模型的新型前馈网络(FFN)架构。TriPLU用直接三线性乘积单元取代了标准门控FFN,该单元将三个学习到的特征投影相乘。在TinyStories数据集上的实验中,TriPLU与其他FFN变体相比,验证损失更低。研究表明,在特定的低计算条件下,直接乘积FFN可以提高小型模型的性能,但优化敏感性和缩放行为需要进一步研究。

  7. TOOL · CL_193835 ·

    新研究诊断出仅解码器Transformer中的秩崩溃问题

    一篇新研究论文发布在arXiv上,详细介绍了一种用于理解后归一化解码器Transformer中秩崩溃的机制性诊断方法。该研究分析了这些模型中的因果注意力如何导致高相似度表示,以及为什么训练动态未能纠正这一点。研究提出了一个使用token相似度作为状态变量的两阶段分析,解释了初始化和后续训练动态如何导致梯度消失和模型崩溃。

  8. TOOL · CL_191353 ·

    研究发现 SwiGLU 的开放正尾对语言模型并非必需

    研究人员调查了 SwiGLU 的开放正尾在仅解码器语言模型中的必要性。他们引入了 MemGLU 作为闭尾替代方案,并发现,在多次预训练运行中,MemGLU 在验证 NLL 方面表现几乎与 SwiGLU 一样好。尽管 SwiGLU 检查点对正尾抑制敏感,但机制诊断显示,尽管性能相似,两种模型在门控使用上存在差异。这些发现表明,语言模型会适应预训练期间提供的门控几何形状,这表明 SwiGLU 的开放正尾对于测试规模下的仅解码器语言模型 F…

  9. RESEARCH · CL_193344 ·

    UniMoMo框架压缩MoE推荐模型以加速推理

    研究人员开发了UniMoMo,一个训练后压缩框架,旨在加速使用混合专家(MoE)层的推荐模型。该方法根据专家的功能相似性而非参数距离对专家进行分组,并使用无标签的校准数据来评估专家对推荐状态的响应相似度。UniMoMo还引入了一个层自适应保护机制,通过限制高流量专家的合并来防止性能下降。在Amazon Beauty、KuaiRec和TenRec等数据集上的实验表明,将MoE模型压缩到更少的专家数量可以显著提高推理速度,同时保持高质量的推荐效果。

  10. TOOL · CL_189340 ·

    乐高积木类比解析现代GPT架构及效率提升

    本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。

  11. TOOL · CL_187898 ·

    llama.cpp 发布包含服务器改进和性能优化 · 跟踪 8 个来源

    llama.cpp 项目发布了多个更新,包括 b10331 版本,该版本通过正确报告隔离工作目录来改进服务器功能。其他近期版本,如 b10330 及更早版本,则侧重于 CUDA 操作的性能优化、SYCL 的错误修复以及跨 macOS、Linux、Android 和 Windows 等各种平台的通用系统兼容性。这些更新反映了 llama.cpp 库在高效本地 LLM 部署方面的持续开发和完善。

  12. TOOL · CL_174098 ·

    新的Prox方法通过前馈网络激活稀疏性提高LLM效率

    研究人员开发了一种名为Prox的新型无训练方法,通过稀疏化其前馈网络(FFNs)来提高大型语言模型(LLMs)的效率。Prox利用SwiGLU激活的中间状态作为通道选择信号,并对其进行近似以降低计算成本。这种方法可以在模型质量没有显著下降的情况下实现FFN的稀疏执行,在各种LLM上优于现有的无训练方法,并实现了显著的加速。

  13. SIGNIFICANT · CL_167987 ·

    Kimi K3 揭示长上下文和代理任务的架构创新

    Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访…

  14. TOOL · CL_154435 ·

    新研究深入探究小语言模型中的真理表征

    研究人员探索了小语言模型中真理表征的内部机制,该研究建立在先前识别出通用真理子空间的工作之上。他们的调查显示,这些真理子空间的维度依赖于模型的知识库,随着知识的减少或材料异质性的增加而变得更加弥散。研究还发现,虽然注意力层传播真理框架,但前馈网络则与之对抗,并且SwiGLU值流与真理衰减存在因果关系。此外,每个类别的真理轴形成一个语义签名的排列,该排列在不同的模型家族中收敛,表明存在一个知识门控律而非架构律。

  15. TOOL · CL_143855 ·

    新框架增强了机器从面部表情分析人类情感的能力

    研究人员开发了一个新颖的情感行为分析框架,专注于提高机器从面部表情推断人类情绪状态的准确性。所提出的方法引入了因果监督,以确保注意力机制专注于真正具有预测性的面部区域,而不是虚假的相关性。它还结合了互协方差正则化和门控非线性SwiGLU变换,以增强特征表达能力并捕捉更细微的情感线索。该方法在第11届野外情感行为分析竞赛中取得了优异的成绩,在效价-唤醒度估计、表情识别和动作单元检测方面取得了具体分数。

  16. RESEARCH · CL_141157 ·

    Amplitude Gating 改进 LLM 结构化输出,无需重新训练

    研究人员开发了一种名为 Amplitude Gating (AG) 的新方法,可在推理过程中改进大型语言模型的结构化输出,而无需重新训练。该技术可调节前馈网络 (FFN) 中的激活幅度,保留预训练权重。AG 在工具结构化任务上显示出特别的潜力,提高了 Qwen3.5-9B 和 Qwen3-8B 等模型的性能,在函数调用和 JSON 模式任务上取得了显著的提升。

  17. TOOL · CL_129216 ·

    新内核通过融合 SwiGLU 激活来提高大语言模型推理速度

    研究人员开发了新的技术,通过在瓦片级别将 SwiGLU 激活函数直接融合到 GEMM 操作中,来加速大语言模型 (LLM) 的推理。这些方法使用为 NVIDIA H100 GPU 定制的 CUTLASS 内核实现,显著减少了中间张量物化的相关开销。在 Qwen 2.5 模型上的评估显示,与标准的 PyTorch 实现相比,速度提升高达 2.47 倍,实现了更高的峰值 BF16 利用率,并展示了优于 cuBLAS 等现有库的数值性能。

  18. TOOL · CL_116105 ·

    现代 LLM Transformer 块通过 RMSNorm、GQA 和 MoE 演进

    大型语言模型 (LLM) 中的现代 Transformer 块已超越最初的 2017 年设计,以提高训练稳定性、上下文长度、推理效率和模型容量。关键的进步包括使用 RMSNorm 进行更简单、更稳定的归一化,使用分组查询注意力 (GQA) 和旋转位置嵌入 (RoPE) 来优化注意力机制,以及在前馈网络中使用 SwiGLU 或专家混合 (MoE) 来增强表达能力和容量。这些修改解决了关键的扩展挑战,使大规模 LLM 的开发和部署更加实用。

  19. RESEARCH · CL_99805 ·

    新的 QG-MIL 架构提高了医学影像分析的准确性

    研究人员开发了 QG-MIL,这是一种新颖的门控 Transformer 聚合器,旨在提高医学影像中多实例学习 (MIL) 的稳定性和准确性。这种新架构通过引入基于 RMSNorm 的预归一化、每头 QK 归一化、细粒度注意力输出门控和 SwiGLU 前馈模块来解决过度自信和不稳定的预测问题。QG-MIL 在病理学和血液学六个基准测试中表现出色,平均比现有方法高出 6.1 个宏平均 F1 分数,并显示出更分布式的实例加权。

  20. TOOL · CL_95483 ·

    xFormers 库可在 GPU 上实现内存高效的 Transformer 模型

    本教程演示了如何使用 xFormers 库在 GPU 上构建内存高效的 Transformer 模型。它涵盖了实现和比较内存高效注意力与标准注意力,分析了因果掩码、打包序列、分组查询注意力 (GQA) 和 ALiBi 位置偏差等技术。该指南还展示了如何将这些方法结合到一个可训练的 GPT 风格模型中,该模型利用 xFormers 注意力和 SwiGLU 前馈层进行自动混合精度训练。