PulseAugur
实时 06:51:28
实体 feed forward network

feed forward network

PulseAugur coverage of feed forward network — every cluster mentioning feed forward network across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_169757 ·

    FFNet推出用于视觉任务的高效卷积混合器

    研究人员推出FFNet,这是一种新颖的卷积混合器架构,旨在提高计算机视觉任务的效率。FFNet将Transformer的前馈网络(FFN)组件重新解释为内存网络,并侧重于查询-键-值框架。通过用大核卷积替换自注意力并利用GELU激活,FFNet旨在比现有方法更有效地捕获空间模式。提出的MetaMixer架构概括了这种方法,为混合器设计提供了一个灵活的框架。

  2. TOOL · CL_119346 ·

    FaceMoE架构提升低分辨率人脸识别性能

    研究人员推出了一种新颖的专家混合(MoE)Transformer架构FaceMoE,旨在提高低分辨率人脸识别能力。该架构采用专门的前馈网络专家和top-k路由器,动态分配token,促进不同面部区域的专家专业化。FaceMoE旨在增强低分辨率图像中的特征提取和聚合,同时缩小高分辨率和低分辨率数据之间的域差距。模型采用组合损失函数进行训练,以确保专家专业化和训练稳定性。大量实验表明,该模型在各种基准测试中均优于现有最先进方法。

  3. TOOL · CL_106708 ·

    深入解析 Transformer 块:大型语言模型的核心组件

    本文深入解析了完整的 Transformer 块,这是许多大型语言模型 (LLM) 中使用的 Transformer 架构的核心组件。文章解释了该块的可并行处理能力以及捕捉长距离依赖关系的能力,使其在语言翻译和摘要等任务中效率很高。解释涵盖了该块的两个主要部分:自注意力机制和前馈网络,并详细介绍了它们的数学函数和实际应用。

  4. RESEARCH · CL_100090 ·

    新研究深入探讨 Transformer 的能耗、学到的线性以及训练动态

    近期研究探索了 Transformer 模型的复杂性,重点关注其能耗、内部线性特性和训练动态。其中一篇论文引入了一个缩放模型,用于预测微调期间的能耗,该模型受 Roofline 模型启发,并考虑了并行效应。另一项研究调查了 Transformer 前馈块的线性,揭示了这种特性是学到的而非架构性的,并且在不同层之间存在显著差异。第三篇论文通过连续深度均场控制的视角分析了 Transformer 层,将交叉熵训练与最优控制问题联系起来。此…

  5. RESEARCH · CL_12995 ·

    Hugging Face 推出 Graph Memory Transformer,用学习到的内存图替换 FFN

    研究人员开发了一种图内存 Transformer (GMT),它用显式的学习内存图替换了仅解码器 Transformer 中的标准前馈网络 (FFN) 子层。这种新架构保持了因果自注意力,但使用内存单元通过由有向转移矩阵连接的质心库来路由 token 表示。虽然具有 8220 万个参数的 GMT 模型训练稳定并提供可检查的组件,但它在验证损失和困惑度方面目前表现不如密集 GPT 风格的基线,尽管它在零样本基准测试中的行为相当。

  6. RESEARCH · CL_06296 ·

    图记忆Transformer用学习到的记忆图替换FFN,以提高可解释性

    研究人员开发了一种图记忆Transformer (GMT),它用显式的学习记忆图替换了仅解码器语言模型中的标准前馈网络 (FFN) 子层。这种新架构 GMT v7 在其 16 个 Transformer 块中的每一个块内使用了 128 个质心和一个有向转移矩阵。虽然参数量为 8220 万的 GMT 模型在零样本基准测试性能上与更大的 GPT 风格基线相当,但在验证损失和困惑度方面落后,这表明未来有优化的潜力和扩展性。