feed-forward networks
PulseAugur coverage of feed-forward networks — every cluster mentioning feed-forward networks across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
研究发现:长上下文训练可能损害大型语言模型的知识
一篇新研究论文提出了“信息丰富悖论”,挑战了大型语言模型中更长上下文窗口总是能提高性能的假设。研究表明,训练过程中过多的相关信息会降低模型进行参数化编码知识的动力,导致过度依赖上下文。这种现象在语言建模、自然语言理解和闭卷问答任务中,超过某个中间最优值后,会降低性能。研究表明,使用信息丰富的上下文进行训练会将梯度压力从与参数化知识相关的馈送网络转移到注意力模块,从而在推理过程中增加上下文依赖性。
-
新方法使用几何分析优化Transformer FFN宽度
研究人员开发了一种新颖的方法来优化Transformer模型中前馈网络(FFN)的宽度,摒弃了标准的恒定宽度。通过分析token表示的几何变化,他们提出了一种逐层分配策略,可以降低验证损失。该方法在各种预训练语言模型上进行了测试,与均匀宽度分配相比,在较大的训练运行中显示出改进。
-
Apple 发布 MemoryLLM,用于可解释的 Transformer FFN
Apple 的机器学习研究团队推出 MemoryLLM,这是一种增强 Transformer 模型中前馈网络 (FFN) 可解释性的新方法。通过将 FFN 与自注意力机制解耦,MemoryLLM 将 FFN 视为无上下文的神经检索记忆,从而可以研究输入 token 如何访问和利用 FFN 参数。这种方法允许将 FFN 作为 token 级别的查找进行预计算,通过允许在 VRAM 和存储之间按需传输来提高推理效率。此外,还提出了 Fle…
-
新研究揭示LLM前馈层中的关键损失通道
研究人员在大型语言模型(LLM)的前馈层中识别出一种特定的组织结构,称为“超级节点”(supernodes)和“光环”(halos)。这些超级节点代表了模型性能的关键通道的一小部分,却占有显著的损失敏感性。该研究分析了Llama-3.1-8B和Mistral-7B等模型,发现保留这些关键通道对于有效的模型剪枝和保持性能至关重要。