PulseAugur
实时 10:49:27
实体 feed forward network

feed forward network

PulseAugur coverage of feed forward network — every cluster mentioning feed forward network across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_259468 ·

    新方法提高点云Transformer的效率

    研究人员推出了一种名为位置锚点调优(Position Anchor Tuning, PAT)的新型参数高效微调方法,旨在提高预训练点云Transformer的推理效率。PAT通过使用令牌聚合和扩展模块来解决多头注意力和前馈网络块中的计算成本。这些模块提取代表性令牌进行处理,从而降低计算负载,然后将学习到的表示传播回原始令牌。该方法还结合了基础共享低秩适配(BSLoRA),以通过最少的训练参数实现任务特定表示的有效学习。

  2. RESEARCH · CL_223280 ·

    新度量优化 sLLM 量化以兼顾速度和质量

    研究人员开发了一种新的度量方法,用于优化资源有限设备上的小型语言模型 (sLLM) 的量化。该度量方法通过信号量化噪声比 (SQNR) 衡量信息保留,并通过基于峰值利用率建模估算的吞吐量增益来平衡两者。对 Gemma 3:1B 模型进行的分析显示,前馈神经网络块和嵌入矩阵是加速的关键目标。所提出的分析方法旨在使 sLLM 量化成为一项更可预测的工程任务,在加速速度预测方面误差约为 4%。

  3. TOOL · CL_180689 ·

    Transformer理论扩展至包含前馈网络

    研究人员开发了Transformer的扩展动力学理论,将前馈网络(FFN)纳入为局部转向场。该新理论表明,FFN的切向分量对于在残差方向空间中的移动至关重要,并且具有小换向器缺陷的层可以并行化。对GPT-2、Pythia、Mistral和Llama模型的实验表明,该扩展理论提高了单步角度预测的准确性,并且FFN的贡献在Llama 3-8B等后期模型中有所增加。干预实验证实,切向FFN分量对于维持模型质量和输出多样性至关重要。

  4. TOOL · CL_169757 ·

    FFNet推出用于视觉任务的高效卷积混合器

    研究人员推出FFNet,这是一种新颖的卷积混合器架构,旨在提高计算机视觉任务的效率。FFNet将Transformer的前馈网络(FFN)组件重新解释为内存网络,并侧重于查询-键-值框架。通过用大核卷积替换自注意力并利用GELU激活,FFNet旨在比现有方法更有效地捕获空间模式。提出的MetaMixer架构概括了这种方法,为混合器设计提供了一个灵活的框架。

  5. TOOL · CL_119346 ·

    FaceMoE架构提升低分辨率人脸识别性能

    研究人员推出了一种新颖的专家混合(MoE)Transformer架构FaceMoE,旨在提高低分辨率人脸识别能力。该架构采用专门的前馈网络专家和top-k路由器,动态分配token,促进不同面部区域的专家专业化。FaceMoE旨在增强低分辨率图像中的特征提取和聚合,同时缩小高分辨率和低分辨率数据之间的域差距。模型采用组合损失函数进行训练,以确保专家专业化和训练稳定性。大量实验表明,该模型在各种基准测试中均优于现有最先进方法。

  6. TOOL · CL_106708 ·

    深入解析 Transformer 块:大型语言模型的核心组件

    本文深入解析了完整的 Transformer 块,这是许多大型语言模型 (LLM) 中使用的 Transformer 架构的核心组件。文章解释了该块的可并行处理能力以及捕捉长距离依赖关系的能力,使其在语言翻译和摘要等任务中效率很高。解释涵盖了该块的两个主要部分:自注意力机制和前馈网络,并详细介绍了它们的数学函数和实际应用。

  7. RESEARCH · CL_100090 ·

    新研究深入探讨 Transformer 的能耗、学到的线性以及训练动态

    近期研究探索了 Transformer 模型的复杂性,重点关注其能耗、内部线性特性和训练动态。其中一篇论文引入了一个缩放模型,用于预测微调期间的能耗,该模型受 Roofline 模型启发,并考虑了并行效应。另一项研究调查了 Transformer 前馈块的线性,揭示了这种特性是学到的而非架构性的,并且在不同层之间存在显著差异。第三篇论文通过连续深度均场控制的视角分析了 Transformer 层,将交叉熵训练与最优控制问题联系起来。此…

  8. RESEARCH · CL_12995 ·

    Hugging Face 推出 Graph Memory Transformer,用学习到的内存图替换 FFN

    研究人员开发了一种图内存 Transformer (GMT),它用显式的学习内存图替换了仅解码器 Transformer 中的标准前馈网络 (FFN) 子层。这种新架构保持了因果自注意力,但使用内存单元通过由有向转移矩阵连接的质心库来路由 token 表示。虽然具有 8220 万个参数的 GMT 模型训练稳定并提供可检查的组件,但它在验证损失和困惑度方面目前表现不如密集 GPT 风格的基线,尽管它在零样本基准测试中的行为相当。

  9. RESEARCH · CL_06296 ·

    图记忆Transformer用学习到的记忆图替换FFN,以提高可解释性

    研究人员开发了一种图记忆Transformer (GMT),它用显式的学习记忆图替换了仅解码器语言模型中的标准前馈网络 (FFN) 子层。这种新架构 GMT v7 在其 16 个 Transformer 块中的每一个块内使用了 128 个质心和一个有向转移矩阵。虽然参数量为 8220 万的 GMT 模型在零样本基准测试性能上与更大的 GPT 风格基线相当,但在验证损失和困惑度方面落后,这表明未来有优化的潜力和扩展性。