transformer layers
PulseAugur coverage of transformer layers — every cluster mentioning transformer layers across labs, papers, and developer communities, ranked by signal.
-
研究发现:字节级语言模型受层级设计限制
一篇题为“推翻字节级语言模型的层级结构”的新研究论文,对当前字节级语言模型中层级结构的有效性提出了质疑。研究发现,这些模型为了效率而先降采样到词级别,然后再升采样回字节级别,实际上限制了对细粒度字符的理解。纯粹的字节级模型,没有这种层级结构,在字符操作任务上表现出更优越的性能。研究指出,字节级注意力是导致这种改进的字符级理解能力的关键机制,表明计算效率与详细字符理解之间存在权衡。
-
双语AI模型显示隐藏状态差异,尽管嵌入已对齐
一篇题为“双重麻烦:双语预训练在共享语言表示中留下语言条件效应”的新研究论文指出了比较多语言语言模型的一个关键缺陷。研究人员发现,虽然对仅英语模型和双语模型的嵌入空间进行对齐可以使词元嵌入看起来相似,但用于预测的更深层隐藏状态并未对齐。这种在八种不同语言中观察到的差异表明,嵌入对齐可能会掩盖模型内部显著的表示差异,从而影响跨语言迁移和可解释性研究的可靠性。
-
新的LoRA-CRAFT方法大幅减少微调参数
研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。
-
理解 Transformer:从分词到自注意力机制
本文剖析了 Transformer 模型背后的核心概念,重点介绍了它们如何处理语言。文章解释了分词(tokenization),即将文本分割成更小的片段,以及分词 ID(token IDs),即这些片段的数值表示。该过程继续介绍嵌入(embeddings),将分词转换为捕获它们之间关系的向量,以及位置编码(positional encoding),它为序列中分词的位置添加信息。最后,文章深入探讨了自注意力机制(self-attenti…
-
新的 IG-Lens 方法可精确归因 Transformer 层之间的 token 概率
研究人员开发了 IG-Lens,一种用于在仅解码器的 Transformer 模型中精确归因预测 token 概率到特定层的新颖方法。与提供近似或有偏估计的现有工具不同,IG-Lens 使用望远积分梯度在概率空间中提供精确的加性分解。这种方法考虑了 softmax 非线性,确保跨层的归因总和精确匹配预测概率的总变化。