feed forward network
PulseAugur coverage of feed forward network — every cluster mentioning feed forward network across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
FFNet推出用于视觉任务的高效卷积混合器
研究人员推出FFNet,这是一种新颖的卷积混合器架构,旨在提高计算机视觉任务的效率。FFNet将Transformer的前馈网络(FFN)组件重新解释为内存网络,并侧重于查询-键-值框架。通过用大核卷积替换自注意力并利用GELU激活,FFNet旨在比现有方法更有效地捕获空间模式。提出的MetaMixer架构概括了这种方法,为混合器设计提供了一个灵活的框架。
-
FaceMoE架构提升低分辨率人脸识别性能
研究人员推出了一种新颖的专家混合(MoE)Transformer架构FaceMoE,旨在提高低分辨率人脸识别能力。该架构采用专门的前馈网络专家和top-k路由器,动态分配token,促进不同面部区域的专家专业化。FaceMoE旨在增强低分辨率图像中的特征提取和聚合,同时缩小高分辨率和低分辨率数据之间的域差距。模型采用组合损失函数进行训练,以确保专家专业化和训练稳定性。大量实验表明,该模型在各种基准测试中均优于现有最先进方法。
-
深入解析 Transformer 块:大型语言模型的核心组件
本文深入解析了完整的 Transformer 块,这是许多大型语言模型 (LLM) 中使用的 Transformer 架构的核心组件。文章解释了该块的可并行处理能力以及捕捉长距离依赖关系的能力,使其在语言翻译和摘要等任务中效率很高。解释涵盖了该块的两个主要部分:自注意力机制和前馈网络,并详细介绍了它们的数学函数和实际应用。
-
新研究深入探讨 Transformer 的能耗、学到的线性以及训练动态
近期研究探索了 Transformer 模型的复杂性,重点关注其能耗、内部线性特性和训练动态。其中一篇论文引入了一个缩放模型,用于预测微调期间的能耗,该模型受 Roofline 模型启发,并考虑了并行效应。另一项研究调查了 Transformer 前馈块的线性,揭示了这种特性是学到的而非架构性的,并且在不同层之间存在显著差异。第三篇论文通过连续深度均场控制的视角分析了 Transformer 层,将交叉熵训练与最优控制问题联系起来。此…
-
Hugging Face 推出 Graph Memory Transformer,用学习到的内存图替换 FFN
研究人员开发了一种图内存 Transformer (GMT),它用显式的学习内存图替换了仅解码器 Transformer 中的标准前馈网络 (FFN) 子层。这种新架构保持了因果自注意力,但使用内存单元通过由有向转移矩阵连接的质心库来路由 token 表示。虽然具有 8220 万个参数的 GMT 模型训练稳定并提供可检查的组件,但它在验证损失和困惑度方面目前表现不如密集 GPT 风格的基线,尽管它在零样本基准测试中的行为相当。
-
图记忆Transformer用学习到的记忆图替换FFN,以提高可解释性
研究人员开发了一种图记忆Transformer (GMT),它用显式的学习记忆图替换了仅解码器语言模型中的标准前馈网络 (FFN) 子层。这种新架构 GMT v7 在其 16 个 Transformer 块中的每一个块内使用了 128 个质心和一个有向转移矩阵。虽然参数量为 8220 万的 GMT 模型在零样本基准测试性能上与更大的 GPT 风格基线相当,但在验证损失和困惑度方面落后,这表明未来有优化的潜力和扩展性。