PulseAugur
实时 01:24:52
实体 multi-head attention

multi-head attention

PulseAugur coverage of multi-head attention — every cluster mentioning multi-head attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 22
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 21
层级分布 · 90 天
主题
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 22 条
  1. TOOL · CL_244431 ·

    多头注意力机制:现代大语言模型的核心

    多头注意力机制是Transformer架构中的一项关键创新,它使现代大语言模型(LLMs)能够并行处理序列并理解长距离依赖关系。与之前的RNN和CNN等方法不同,它允许模型通过多个注意力头同时关注输入的不同部分,每个注意力头都能学习到数据中不同的视角。这种基于缩放点积注意力(Scaled Dot-Product Attention)的机制显著提高了在GPU上的训练效率,并增强了模型理解复杂语言细微差别以完成机器翻译等任务的能力。

  2. RESEARCH · CL_231584 ·

    研究质疑关系嵌入在 LLM 中的有效性

    一篇新研究论文探讨了通过将关系编码器嵌入作为软 token 注入 Qwen3.5-4B 来将其集成到大型语言模型 (LLM) 中。研究发现,这种混合方法并未持续优于独立的关系 Transformer,通常表现不佳并在训练期间显示出不稳定性。研究人员建议,要在 LLM 中成功进行软 token 融合以完成关系预测任务,需要更强大的对齐目标和模式感知设计。

  3. TOOL · CL_212033 ·

    面向大型MoE模型的计算高效超参数迁移

    研究人员开发了一个计算高效的框架,用于确定大型混合专家(MoE)模型中的最优学习率。这个两步过程包括在不同宽度的模型之间迁移最优学习率,然后推断到海量token预算。通过在小型代理模型上进行线性回归,该方法可以准确预测长达10万亿token的训练视野的理想学习率,显著降低了计算成本。该框架成功应用于预训练一个1550亿参数的基础模型,验证了其有效性。

  4. TOOL · CL_211986 ·

    新的非对称注意力头框架优化Transformer上下文分配

    研究人员开发了一个名为非对称注意力头(AAH)的新框架,旨在优化Transformer模型内的上下文分配。与所有注意力头接收相同上下文的标准多头注意力不同,AAH允许每个注意力头或一组注意力头具有可变的上下文长度。这种方法旨在通过让一些注意力头专注于局部上下文,而另一些注意力头处理长距离依赖关系来提高效率和性能。在4096个token设置下使用AAH进行的初步实验显示出有希望的结果,某些变体相比全注意力实现了更低的验证损失。

  5. TOOL · CL_216306 ·

    新框架高效预测大型MoE模型最优学习率

    研究人员开发了一种新颖的两步框架,可高效确定大型混合专家(MoE)模型的最优学习率。该方法利用不同模型宽度之间的超参数迁移,并将研究结果外推到海量token预算,显著降低了传统超参数搜索的计算成本。该框架采用了最大更新参数化(Maximal Update Parameterization)的适配和Muon优化器,并成功应用于预训练一个155B参数的基础模型,证明了其在预测大规模MoE训练最优配置方面的有效性。

  6. TOOL · CL_204044 ·

    新的机器学习模型通过先进的插补技术改进岩土强度预测

    研究人员开发了用于预测岩土工程中不排水抗剪强度的新概率间接模型,解决了显著的数据缺失和变异性挑战。该研究使用了CLAY/10/7490全球数据库,并测试了三种插补方法:多元正态(MN)、链式方程多重插补(MICE)和随机森林插补(miss forest, MF)。采用了概率极端梯度提升(PXGB)模型来评估插补效果。此外,还将多头注意力(MHA)机制集成到人工神经网络(ANN)中,创建了基于MHA的概率神经网络(MHA-PNN),与传…

  7. RESEARCH · CL_198792 ·

    理解 Transformer:从分词到自注意力机制

    本文剖析了 Transformer 模型背后的核心概念,重点介绍了它们如何处理语言。文章解释了分词(tokenization),即将文本分割成更小的片段,以及分词 ID(token IDs),即这些片段的数值表示。该过程继续介绍嵌入(embeddings),将分词转换为捕获它们之间关系的向量,以及位置编码(positional encoding),它为序列中分词的位置添加信息。最后,文章深入探讨了自注意力机制(self-attenti…

  8. COMMENTARY · CL_190013 ·

    KV 缓存成为 LLM 瓶颈,推动注意力变体创新

    KV 缓存是 LLM 自回归解码的关键组成部分,被确定为 2026 年前沿模型的主要瓶颈。其大小随上下文长度和批处理大小线性增长,使其成为比模型权重更主要的内存消耗者。缓解此瓶颈的技术包括减少 KV 头(MQA、GQA)、使用潜在表示压缩缓存(MLA)以及通过线性注意力或状态空间模型(SSMs)完全消除不断增长的缓存。2026 年的主流方法是混合模型,它将全注意力层与线性/SSM 层交织在一起,以平衡质量和内存效率。

  9. FRONTIER RELEASE · CL_192292 ·

    Motif Technologies 发布 314B 参数的 Motif 3 LLM

    Motif Technologies 发布了 Motif 3,这是一款拥有 3140 亿总参数和每个 token 激活 132 亿参数的 decoder-only 混合专家(Mixture-of-Experts)语言模型。该模型采用了新颖的 Grouped Differential Latent Attention 架构,并在约 12.5 万亿个 token 上进行了训练。Motif 3 在与领先的开源模型相比时,表现出具有竞争力的性…

  10. TOOL · CL_185407 ·

    新研究量化了多任务计算所需的注意力头数量

    一篇新研究论文探讨了多头注意力层在为各种计算任务生成向量表示方面的能力。该研究为特定场景下所需的注意力头数量设定了理论界限,例如使用线性预测器计算列表中的最小值和最大值。它还分析了计算位字符串的XOR所需的阈值多项式函数,证明了头数与多项式次数的乘积至少需要为n。

  11. TOOL · CL_183329 ·

    新算法可证明地学习多头注意力参数

    研究人员开发了一种学习多头softmax注意力的新方法,这是Transformer模型中的一个关键组成部分。这种新算法可以在不需要先验知识正交子空间的情况下恢复这些注意力头的参数,而这是先前方法的局限性。该方法通过合并具有相同权重的头并对其对应的数值进行求和来实现,从而有效地创建了一个规范表示。该算法通过查询任意token序列并分析由此产生的标量输出来实现这一点,使用特定数量的查询来高概率地重建注意力头参数。

  12. TOOL · CL_180878 ·

    新的几何框架分析大型语言模型注意力中的 token 选择

    研究人员开发了一个新的几何框架来分析大型语言模型(LLMs)中多头注意力的行为。该方法将注意力视为 value-state 空间内的 top-N 选择过程,定义了精确率、召回率和 F 分数等指标来衡量 token 的可分离性。该理论预测了最佳操作模式,并解释了序列长度和 token 相似性如何影响这些指标。对 LLaMA-2-7B、Gemma-7B 和 Mistral-7B 模型的实证测试表明,注意力功能类似于结构化的几何分类器,从而…

  13. RESEARCH · CL_167724 ·

    新方法提升扩散 Transformer 的效率和性能 · 跟踪 4 个来源

    研究人员开发了新方法来提高扩散 Transformer 的效率和性能,这是 AI 图像和视频生成的一个关键架构。Chimera,一种混合视觉扩散骨干网络,结合了不同的注意力机制和一种新颖的缩放方法,与传统模型相比,实现了显著的计算效率提升。此外,MMOE 通过借鉴大型语言模型的高效专家设计,实现了扩散 Transformer 的现代化,从而加快了收敛速度并改善了质量-成本平衡。Calibri 提供了一种参数高效的扩散 Transfor…

  14. RESEARCH · CL_167344 ·

    新研究剖析大型语言模型和多模态大型语言模型中的注意力机制

    两篇新研究论文深入探讨了大型语言模型中注意力机制的内部工作原理。第一篇论文分析了DeepSeek-V2中使用的多头潜在注意力(MLA),发现它通过压缩键值对有效地将内容与位置信息分离开来。第二篇论文解决了多模态模型中注意力不成比例地集中在无信息量视觉标记上的现象,称之为“视觉注意力汇聚”,并提出了一种名为SPAR的新方法来缓解这种偏差。

  15. TOOL · CL_100203 ·

    新框架统一分析深度Transformer动力学

    研究人员开发了一个新颖的框架来分析深度Transformer内部的复杂动力学,Transformer是许多机器学习任务的基础。通过将输入序列的演化建模为Vlasov方程,称为Transformer PDE,他们可以更好地理解注意力机制如何在层之间运作。该方法已推广到各种注意力变体,包括多头注意力、L2注意力、Sinkhorn注意力、Sigmoid注意力和掩码注意力,利用条件Wasserstein框架。该研究还独特地探索了非紧支撑的初始…

  16. RESEARCH · CL_103889 ·

    HydraHead架构融合了多种注意力类型,以改进长上下文LLM

    研究人员推出了一种新颖的HydraHead架构,该架构在Transformer模型内部的头级别上混合了全注意力(Full Attention)和线性注意力(Linear Attention)。该方法利用可解释性来识别全注意力的关键头,同时使用尺度归一化融合模块来整合两种注意力类型的输出。该方法旨在以更低的训练开销来提高长上下文性能,即使在有限的训练数据下也能取得显著的收益,并接近Qwen 3.5等更大模型的性能。

  17. RESEARCH · CL_93581 ·

    新的QK-Normed MLA方法在无需完全缓存键的情况下稳定LLM注意力

    研究人员开发了QK-Normed MLA,一种无需完全缓存键即可稳定大型语言模型中注意力机制的方法。该技术通过分解RMSNorm并将静态权重吸收到现有投影中,将QK归一化集成到多头潜在注意力(MLA)中。与QK剪枝相比,该方法在保持MLA高效解码的同时,实现了更低的训练损失和更高的下游准确性,并且在Nvidia H800硬件上具有最小的延迟开销。

  18. RESEARCH · CL_72610 ·

    深度学习从2D图像重建3D口腔模型

    研究人员开发了一种新颖的深度学习方法,仅使用2D口内图像即可重建口腔的3D模型。该方法旨在降低传统牙科建模技术(如印模采集和昂贵的口内扫描仪)的成本和患者不适感。该模型在Dental3DS数据集上进行训练,利用MobileNetV2和多头注意力机制实现了77.49%的准确率,但指出重建中的点分布不均。

  19. TOOL · CL_55488 ·

    大语言模型深度解析:理解Transformer中的多头注意力机制

    本文深入探讨了多头注意力机制,这是Transformer架构和大语言模型(LLMs)的核心组成部分。文章解释了该机制如何通过关注不同的表示子空间并捕捉长距离依赖关系,使模型能够处理序列数据。文章详细介绍了自注意力机制的数学基础及其扩展到多头注意力的过程,强调了其并行性和大规模计算的效率。

  20. RESEARCH · CL_45905 ·

    新的MLA注意力机制将LLM KV缓存削减高达10倍

    多头潜在注意力(MLA)是一种新颖的注意力机制,旨在显著压缩大型语言模型的KV缓存。通过将KV对投影到低维潜在空间,MLA实现了大量的缓存缩减,使DeepSeek-V2/V3和Kimi K2.x等模型能够以更少的内存处理更长的上下文和更大的批次。该技术改变了前缀缓存和注意力计算的实现方式,在模型推理过程中提供了内存使用和计算成本之间更有效的权衡。