PulseAugur
实时 13:56:09
实体 Full Attention

Full Attention

PulseAugur coverage of Full Attention — every cluster mentioning Full Attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_191193 ·

    新的Autonomy-of-Heads方法在无需数据的情况下提高了LLM效率

    研究人员开发了一种名为Autonomy-of-Heads (AoH) 的新型无数据方法,以提高长上下文大型语言模型 (LLM) 的效率。AoH通过分析查询-键投影的光谱几何结构来识别检索和流式传输的head,这一过程独立于运行时注意力分数。该方法可以将预填充和解码延迟分别降低高达66.0%和41.4%,同时在256K token时将KV缓存内存减少50.0%,并且在50%稀疏度下仍能保留96.5%的完整注意力性能。

  2. TOOL · CL_180556 ·

    Bole系统通过树状推测加速混合注意力LLM推理

    研究人员开发了Bole,一个旨在加速混合注意力大型语言模型(LLM)推理的新系统。这些模型结合了全注意力机制和循环线性注意力机制,以更有效地管理长上下文。Bole通过将线性注意力的循环转换为树状结构,实现了对推测性提议的并行验证,从而解决了这些模型中自回归解码的内存瓶颈问题。这种方法显著减少了瞬时内存使用量,并增加了GPU用于键值缓存的容量,从而大幅提高了解码吞吐量,并缩短了代理工作负载的首次令牌生成时间。

  3. TOOL · CL_137807 ·

    小米详解 MiMo-V2.5 AI 模型效率优化

    小米公司详细介绍了其 MiMo-V2.5 系列 AI 模型背后的工程优化,重点在于实现长上下文推理和多模态任务的效率。与传统的全注意力机制相比,该模型采用混合滑动窗口注意力(Hybrid SWA)来大幅降低 KVCache 的存储和计算成本。进一步的增强包括稀疏 MoE 激活以减少每 token 的计算量,以及用于跨模态理解的多模态编码器。该公司系统地设计了推理系统,以在生产环境中实现这些架构优势,解决了 KVCache 管理、调度和…

  4. RESEARCH · CL_115713 ·

    新的注意力机制提升LLM效率并减少幻觉 · 跟踪10个来源

    研究人员正在开发新颖的注意力机制,以提高大型语言模型(LLM)和多模态大型语言模型(MLLM)的效率和能力。这些进展侧重于优化长上下文的稀疏注意力,降低计算成本,并减轻幻觉和视觉基础薄弱等问题。Flash Sparse Attention (FSA)、Information-Regularized Attention (IRA) 和 Multipole Semantic Attention (MuSe) 等技术旨在提高性能、降低延迟,…

  5. RESEARCH · CL_103889 ·

    HydraHead架构融合了多种注意力类型,以改进长上下文LLM

    研究人员推出了一种新颖的HydraHead架构,该架构在Transformer模型内部的头级别上混合了全注意力(Full Attention)和线性注意力(Linear Attention)。该方法利用可解释性来识别全注意力的关键头,同时使用尺度归一化融合模块来整合两种注意力类型的输出。该方法旨在以更低的训练开销来提高长上下文性能,即使在有限的训练数据下也能取得显著的收益,并接近Qwen 3.5等更大模型的性能。

  6. RESEARCH · CL_93108 ·

    新研究探索用于大型语言模型的混合和稀疏注意力机制

    研究人员正在探索优化大型语言模型中注意力机制的新方法,特别是用于处理长上下文。例如,HydraHead架构沿头轴混合了全注意力(FA)和线性注意力(LA),识别关键的FA头并协调分布差异。另外,StreamKL提供了一种快速且内存高效的方法来计算注意力蒸馏的Kullback-Leibler散度,减少了HBM占用空间,并支持在单个GPU上进行长上下文蒸馏。其他研究包括基于域分解的分层注意力和距离自适应表示,后者为远距离标记分配较低的维度…