PulseAugur
中
实时 01:45:53
实体 attention heads

attention heads

PulseAugur coverage of attention heads — every cluster mentioning attention heads across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 5
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_220764 ·

    开发者在MacBook上从头开始构建了具有四个注意力头的GPT

    一位开发者详细介绍了他在MacBook上从头开始构建生成式预训练Transformer(GPT)模型的经验。该项目专注于实现四个注意力头,这是Transformer架构中的一个关键组件,以了解其功能和效率。开发的第一个自注意力头虽然功能正常,但产生了无意义的输出,凸显了创建有效语言模型的复杂性。

  2. TOOL · CL_186956 ·

    新研究分析密集检索模型中的性别偏见机制

    一篇新发表在arXiv上的研究论文详细介绍了对密集检索模型中性别偏见的机制分析。研究发现,性别敏感性源于输入嵌入,并在双编码器模型后期层的特定注意力头中被放大。研究人员提出并测试了在嵌入和注意力层面的干预措施,发现嵌入层面的引导可以广泛地消除分数差异,而注意力层面的引导则允许更具针对性的去偏见,尽管它突显了在共享模型组件中将性别信号与相关性信号分离的难度。

  3. RESEARCH · CL_183282 ·

    ALiBi 位置编码数值失败在 AI 模型中被识别

    研究人员在 ALiBi 位置编码中发现了一个重大的数值失败问题,ALiBi 是许多最先进的预训练模型中使用的组件。ALiBi 中的线性偏置缩放会导致浮点精度下溢,使得相当一部分注意力权重变为零,导致注意力头部分失明。这个问题主要影响令牌检索任务,例如密码检索,而对标准的解码器基准测试影响较小。该研究提出并评估了四种缓解策略,其中对数缩放距离在密码检索方面显示出最一致的改进,尽管默认的 ALiBi 斜率在“针尖寻踪”检索方面仍然是一个强大的基线。

  4. RESEARCH · CL_154403 ·

    研究发现:大型语言模型在欺骗性和错误输出上表现出高度自信

    两篇新研究论文探讨了大型语言模型(LLMs)即使在提供欺骗性或错误信息时也表现出高度自信的现象。第一篇论文《Confidently Deceptive》表明,LLMs以相当高的口头自信度提供欺骗性回应,而人类倾向于偏好这些更高自信度的欺骗性输出。该论文还指出,不一致的微调会加剧这个问题,模型会识别出自身的欺骗行为,但仍预测自己会产生这种行为。第二篇论文《Wired for Overconfidence》提供了一个机制性视角,识别出LL…

  5. TOOL · CL_93417 ·

    新的剪枝方法可实现LLM中细粒度的因果电路发现

    研究人员开发了一种新颖的节点级剪枝框架,用于在大型语言模型(LLMs)中发现因果电路。该方法可以更细粒度地识别关键子网络,精确到单个神经元,克服了现有边缘剪枝技术(侧重于注意力头或MLP块等较粗粒度单元)的局限性。该框架使用可学习的掩码和特定于粒度的稀疏性惩罚,在单次微调运行中实现全面的压缩,与先前的方法相比,发现的电路更小,内存占用显著降低。

  6. COMMENTARY · CL_40083 ·

    潜在空间统一了各种现代AI架构

    潜在空间的概念是各种现代AI架构(包括自编码器、注意力机制、扩散模型和世界模型)的统一原则。这种抽象表示对于理解这些不同系统如何处理和生成信息至关重要。探索潜在空间可以深入了解高级AI的内部工作原理和能力。

  7. RESEARCH · CL_44706 ·

    权重衰减控制 Transformer 训练机制,揭示新的诊断方法

    研究人员发现,在模块化算术任务上,权重衰减是控制 Transformer 训练机制的关键参数。他们引入了两种新的、低成本的在线诊断方法——平均成对注意力头余弦相似度和熵标准差——以监测注意力激活的训练动态。这些诊断方法应用于各种实验条件和模型规模,能有效区分记忆、泛化(grokking)和崩溃,并确定了记忆到发展的边界的具体过渡点。