实体
transformer blocks
transformer blocks
PulseAugur coverage of transformer blocks — every cluster mentioning transformer blocks across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
乐高积木类比解析现代GPT架构及效率提升
本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。
-
新理论将Transformer上下文映射到MLP权重块
研究人员已经证明,Transformer模型中上下文的影响可以精确地映射到其MLP权重矩阵和RMSNorm尺度上的秩-1块。这个理论框架适用于包括Gemma在内的现代LLM架构,它提供了一种通用的方法来理解提示如何转化为有效权重。这项工作基于输入和输出可控性引入了一个通用框架,证明了具有这些属性的MLP块可以实现隐式权重打补丁。
-
Complete-muE 框架优化混合专家(MoE)模型的超参数迁移
研究人员推出 Complete-muE,一个旨在优化混合专家(MoE)模型超参数迁移的新颖框架。该系统通过实现密集前馈网络与各种 MoE 配置之间的有效超参数迁移,解决了现有工具的局限性。Complete-muE 利用双桥接系统来管理架构和 token 数量的变化,从而可以将在一个单一密集模型上调整的超参数近乎最优地应用于所有 MoE 设置。