PulseAugur
中
实时 20:47:25
实体 Full Attention

Full Attention

PulseAugur coverage of Full Attention — every cluster mentioning Full Attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 9
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_269450 ·

    研究发现:混合注意力机制影响LLM多语言能力

    研究人员调查了大型语言模型(LLM)中的混合注意力机制如何影响其多语言能力。这些模型结合了不同类型的注意力来高效处理长序列。研究发现,注意力层的排列方式显著影响跨语言表征的发展,在第一个全注意力层周围观察到了显著的对齐峰值。在多语言数据上进行蒸馏的实验表明,替代的层序排列,特别是从全注意力层开始,优于标准配置,学习速度提高了2.5倍。

  2. TOOL · CL_286013 ·

    Hugging Face 研究建议重新设计多语言LLM的注意力层

    Hugging Face 的一项新研究调查了混合注意力机制对大型语言模型多语言能力的影响。研究人员发现,循环层和全注意力层的排列方式显著影响跨语言表征的形成,在第一个全注意力层之后出现了一个显著的对齐峰值。在多语言数据上进行蒸馏的实验表明,替代的层序排列,特别是以全注意力层开始的排列,与标准配置相比,学习速度提高了2.5倍,这表明多语言模型架构可能需要重新设计。

  3. TOOL · CL_252199 ·

    新的音乐注意力机制提升了AI音乐生成质量

    研究人员开发了一种名为“音乐注意力”(Musical Attention)的新注意力机制,以改进AI生成的音乐。该方法将乐句编号、调号和速度等音乐元数据直接纳入Transformer的注意力过程中。通过在音高和时长等音乐事件的同时考虑这些结构和元数据特征,该模型能够生成更连贯、更多样化且和声一致的旋律,与之前的Full Attention和Strided Attention等方法相比,显著减少了重复。

  4. TOOL · CL_235558 ·

    新的混合Transformer架构提高了长上下文外推能力

    研究人员开发了一个名为Head-wise Hybrid Architecture (HwH)的新框架,重新评估了现代Transformer的设计。通过使用RoPE Frequency Importance Score (RFIS)和RoPE Positional Dependence (RPD)等指标分析头级别的函数组织,他们识别出检索头和位置头之间的清晰分离。该分析表明,位置建模应该是局部的,通过与位置无关的检索实现全局访问,并且这…

  5. TOOL · CL_191193 ·

    新的Autonomy-of-Heads方法在无需数据的情况下提高了LLM效率

    研究人员开发了一种名为Autonomy-of-Heads (AoH) 的新型无数据方法,以提高长上下文大型语言模型 (LLM) 的效率。AoH通过分析查询-键投影的光谱几何结构来识别检索和流式传输的head,这一过程独立于运行时注意力分数。该方法可以将预填充和解码延迟分别降低高达66.0%和41.4%,同时在256K token时将KV缓存内存减少50.0%,并且在50%稀疏度下仍能保留96.5%的完整注意力性能。

  6. TOOL · CL_180556 ·

    Bole系统通过树状推测加速混合注意力LLM推理

    研究人员开发了Bole,一个旨在加速混合注意力大型语言模型(LLM)推理的新系统。这些模型结合了全注意力机制和循环线性注意力机制,以更有效地管理长上下文。Bole通过将线性注意力的循环转换为树状结构,实现了对推测性提议的并行验证,从而解决了这些模型中自回归解码的内存瓶颈问题。这种方法显著减少了瞬时内存使用量,并增加了GPU用于键值缓存的容量,从而大幅提高了解码吞吐量,并缩短了代理工作负载的首次令牌生成时间。

  7. TOOL · CL_137807 ·

    小米详解 MiMo-V2.5 AI 模型效率优化

    小米公司详细介绍了其 MiMo-V2.5 系列 AI 模型背后的工程优化,重点在于实现长上下文推理和多模态任务的效率。与传统的全注意力机制相比,该模型采用混合滑动窗口注意力(Hybrid SWA)来大幅降低 KVCache 的存储和计算成本。进一步的增强包括稀疏 MoE 激活以减少每 token 的计算量,以及用于跨模态理解的多模态编码器。该公司系统地设计了推理系统,以在生产环境中实现这些架构优势,解决了 KVCache 管理、调度和…

  8. RESEARCH · CL_115713 ·

    新的注意力机制提升LLM效率并减少幻觉 · 跟踪10个来源

    研究人员正在开发新颖的注意力机制,以提高大型语言模型(LLM)和多模态大型语言模型(MLLM)的效率和能力。这些进展侧重于优化长上下文的稀疏注意力,降低计算成本,并减轻幻觉和视觉基础薄弱等问题。Flash Sparse Attention (FSA)、Information-Regularized Attention (IRA) 和 Multipole Semantic Attention (MuSe) 等技术旨在提高性能、降低延迟,…

  9. RESEARCH · CL_103889 ·

    HydraHead架构融合了多种注意力类型,以改进长上下文LLM

    研究人员推出了一种新颖的HydraHead架构,该架构在Transformer模型内部的头级别上混合了全注意力(Full Attention)和线性注意力(Linear Attention)。该方法利用可解释性来识别全注意力的关键头,同时使用尺度归一化融合模块来整合两种注意力类型的输出。该方法旨在以更低的训练开销来提高长上下文性能,即使在有限的训练数据下也能取得显著的收益,并接近Qwen 3.5等更大模型的性能。

  10. RESEARCH · CL_93108 ·

    新研究探索用于大型语言模型的混合和稀疏注意力机制

    研究人员正在探索优化大型语言模型中注意力机制的新方法,特别是用于处理长上下文。例如,HydraHead架构沿头轴混合了全注意力(FA)和线性注意力(LA),识别关键的FA头并协调分布差异。另外,StreamKL提供了一种快速且内存高效的方法来计算注意力蒸馏的Kullback-Leibler散度,减少了HBM占用空间,并支持在单个GPU上进行长上下文蒸馏。其他研究包括基于域分解的分层注意力和距离自适应表示,后者为远距离标记分配较低的维度…