PulseAugur
中
实时 23:56:39
实体 attention weights

attention weights

PulseAugur coverage of attention weights — every cluster mentioning attention weights across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_271147 ·

    研究人员量化语言模型中自注意力机制的令牌检索能力

    研究人员调查了语言模型中自注意力机制的检索能力,旨在了解模型上下文中有多少令牌被实际使用。该研究提出了一种通过保留具有最高注意力权重的令牌并观察其对负对数似然(NLL)的影响来测量有效注意力集合大小的方法。结果表明,相对较小的选定令牌集合可以使NLL接近全注意力基线,并且性能远超随机选择。研究还探讨了扩展上下文、支持事实的存在以及权重重整化如何影响所需的集合大小和模型的整体性能。

  2. RESEARCH · CL_208519 ·

    新理论表明语言需要两个超越词语共现的参数

    一篇新研究论文提出,语言理解依赖于两个参数:幅度(词语共现)和相位(含义如何组合)。作者认为,当前的Transformer模型缺乏相位的显式表示,而相位对于解释讽刺和引语等细微差别至关重要。他们建议未来的语言模型应纳入代理索引的、具有相位的语义状态,以更好地捕捉这些复杂的语言现象。

  3. RESEARCH · CL_183282 ·

    ALiBi 位置编码数值失败在 AI 模型中被识别

    研究人员在 ALiBi 位置编码中发现了一个重大的数值失败问题,ALiBi 是许多最先进的预训练模型中使用的组件。ALiBi 中的线性偏置缩放会导致浮点精度下溢,使得相当一部分注意力权重变为零,导致注意力头部分失明。这个问题主要影响令牌检索任务,例如密码检索,而对标准的解码器基准测试影响较小。该研究提出并评估了四种缓解策略,其中对数缩放距离在密码检索方面显示出最一致的改进,尽管默认的 ALiBi 斜率在“针尖寻踪”检索方面仍然是一个强大的基线。