PulseAugur
实时 12:02:51
实体 transformer layers

transformer layers

PulseAugur coverage of transformer layers — every cluster mentioning transformer layers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_206259 ·

    新的LoRA-CRAFT方法大幅减少微调参数

    研究人员开发了LoRA-CRAFT,一种新颖的参数高效微调方法,它利用Tucker张量分解对跨Transformer层的预训练注意力权重进行分解。与分解梯度更新或独立处理层级的现有方法不同,LoRA-CRAFT直接将分解应用于组织为跨层张量的预训练权重。这种方法冻结了产生的因子,只训练小的变换,在参数显著减少的情况下实现了具有竞争力的性能,尤其是在LLaMA3-8B等大型模型上。

  2. RESEARCH · CL_198792 ·

    理解 Transformer:从分词到自注意力机制

    本文剖析了 Transformer 模型背后的核心概念,重点介绍了它们如何处理语言。文章解释了分词(tokenization),即将文本分割成更小的片段,以及分词 ID(token IDs),即这些片段的数值表示。该过程继续介绍嵌入(embeddings),将分词转换为捕获它们之间关系的向量,以及位置编码(positional encoding),它为序列中分词的位置添加信息。最后,文章深入探讨了自注意力机制(self-attenti…

  3. TOOL · CL_117881 ·

    新的 IG-Lens 方法可精确归因 Transformer 层之间的 token 概率

    研究人员开发了 IG-Lens,一种用于在仅解码器的 Transformer 模型中精确归因预测 token 概率到特定层的新颖方法。与提供近似或有偏估计的现有工具不同,IG-Lens 使用望远积分梯度在概率空间中提供精确的加性分解。这种方法考虑了 softmax 非线性,确保跨层的归因总和精确匹配预测概率的总变化。