PulseAugur
实时 14:08:58
实体 GQA

GQA

PulseAugur coverage of GQA — every cluster mentioning GQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 21
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_193652 ·

    新的TGIF模块可减少多模态大语言模型的幻觉

    研究人员开发了TGIF(文本引导的层间融合),这是一种旨在减少多模态大语言模型(MLLMs)幻觉的新型模块。与以往侧重于文本或静态视觉特征融合的方法不同,TGIF根据输入查询动态地融合来自视觉编码器不同层的视觉特征。这种方法无需更新视觉编码器,并且计算开销极小。当与LLaVA-1.5-7B集成时,TGIF在减少幻觉和提高OCR和VQA任务的性能方面表现出持续的改进,同时在ScienceQA和MMBench等其他基准测试上保持或提高了结果。

  2. COMMENTARY · CL_190013 ·

    KV 缓存成为 LLM 瓶颈,推动注意力变体创新

    KV 缓存是 LLM 自回归解码的关键组成部分,被确定为 2026 年前沿模型的主要瓶颈。其大小随上下文长度和批处理大小线性增长,使其成为比模型权重更主要的内存消耗者。缓解此瓶颈的技术包括减少 KV 头(MQA、GQA)、使用潜在表示压缩缓存(MLA)以及通过线性注意力或状态空间模型(SSMs)完全消除不断增长的缓存。2026 年的主流方法是混合模型,它将全注意力层与线性/SSM 层交织在一起,以平衡质量和内存效率。

  3. FRONTIER RELEASE · CL_182987 ·

    Liquid AI 发布 LFM2.5-2.6B:支持128K上下文的设备端智能体模型

    Liquid AI 发布了 LFM2.5-2.6B,这是一款开源权重、专为移动和边缘设备设计的设备端智能体模型。该模型拥有26.9亿参数,128,000个token的上下文窗口,并且无需依赖云API即可执行多步任务,包括规划和工具调用。Liquid AI 报告称,LFM2.5-2.6B 在指令遵循和工具使用基准测试中,与远大于自身的模型相比,表现具有竞争力,同时在各种硬件上保持了低内存使用和快速解码速度。

  4. TOOL · CL_180947 ·

    注视式探针揭示视觉基础模型中的局部信息

    研究人员开发了一种名为“注视式探针”(foveated probes)的新方法,以更好地评估冻结的视觉基础模型中保留的局部信息。与传统的全局图像嵌入不同,注视式探针使用学习到的或由问题驱动的查询来聚焦于特定的图像区域,模仿人类的视觉注意力。这种方法在需要识别特定对象属性(如颜色和形状)的任务中,尤其是在混乱条件下或处理反事实编辑时,比全局读出更有效。研究表明,这些模型中空间意识的明显局限性可能源于读出接口,而不是模型内部表征本身缺乏信息。

  5. TOOL · CL_177152 ·

    前沿大模型高精度提炼答案集编程理论

    一项新研究探索了使用神经符号方法从大型语言模型中提炼答案集编程(ASP)理论。该研究测试了九个模型,包括 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5 和 DeepSeek V4 Pro 等前沿模型,涵盖了 CLEVR、GQA 和 CLEVRER 三个基准。大多数前沿模型都取得了高精度,其中 Sonnet、Opus 和 DeepSeek V4 Pro 在 CLEVRER 上达到了 90% 以上的准确率…

  6. TOOL · CL_169713 ·

    Argus-Unified模型提供经济高效的图像理解与生成能力

    研究人员开发了Argus-Unified,这是一种新颖的统一多模态模型,专为图像理解和生成而设计。该模型以其紧凑的尺寸和经济高效的训练而著称,它采用了两阶段流水线,并利用了预训练的视觉语言模型。通过采用混合视觉令牌和冻结的视觉编码器,Argus-Unified在GQA、POPE和VQAv2等基准测试中取得了最先进的性能,同时还展示了具有竞争力的生成能力。该开发旨在显著降低创建此类统一模型的成本和数据需求,使其更易于获取。

  7. TOOL · CL_179288 ·

    MAViE编码器将视觉语言模型效率提升80%

    研究人员推出MAViE,一种多尺度自适应视觉编码器,旨在提高视觉语言模型的效率和有效性。MAViE利用位置依赖门控来整合来自视觉Transformer不同深度的特征,从而在保留全局语义的同时增强边缘和文本等局部细节的表示。该系统还采用问题条件令牌路由,根据图像复杂性和问题相关性来调整其令牌预算,显著减少处理的视觉令牌数量并提高推理速度。

  8. TOOL · CL_165821 ·

    分组查询注意力通过减少KV缓存瓶颈优化LLM推理

    分组查询注意力(GQA)是一种通过减少由KV缓存引起内存瓶颈来显著提高大型语言模型推理效率的技术。与使用每个查询头独立的KV头的传统多头注意力(MHA)或跨所有查询头共享单个KV头的多查询注意力(MQA)不同,GQA取得了平衡。它将查询头分组,并在这些组之间共享KV头,从而大大减小了缓存大小和内存带宽需求,而模型质量没有明显损失。这种方法,特别是使用8个KV头,已被Llama和Mistral等模型采用,以使长上下文LLM更加实用。

  9. SIGNIFICANT · CL_164452 ·

    Moonshot AI 发布 Kimi-K3 模型,优化长上下文处理

    Moonshot AI 已在 Hugging Face 上发布 Kimi-K3 模型权重,该模型采用了针对长上下文推理的架构优化。模型采用了修改后的 Transformer 架构,结合了 Grouped Query Attention (GQA) 和类似 vLLM 的分页注意力技术,以高效管理其 KV 缓存,支持长达一百万个 token 的序列。关键配置包括用于位置嵌入稳定性的高 `rope_theta` 值,以及为生产部署而设计的抗…

  10. TOOL · CL_158558 ·

    新研究利用数组数学优化 Transformer 注意力机制

    一篇新的研究论文详细介绍了一种使用数组数学(MoA)优化 Transformer 注意力推理的方法。该论文提出了四种内存高效的构件,包括一种代数消除了 K^T 缓冲区的单查询解码 DNF,实现了特定的 DRAM 流量结果。它还引入了一个具有精确浮点运算的 C/OpenACC GPU 内核和一个具有高效追加操作的多步 KV 缓存。此外,该研究推导出了分组查询注意力(GQA)和多查询注意力(MQA)以减少 KV 流量,所有方法均已通过 P…

  11. TOOL · CL_154709 ·

    研究发现视觉令牌修剪会影响多模态大语言模型的校准

    一篇新的研究论文探讨了视觉令牌修剪对多模态大语言模型(MLLMs)校准的影响。该研究发表在arXiv上,揭示了修剪令牌的方法显著影响模型校准,即模型置信度与其正确性之间的一致性。基于覆盖率的修剪方法,侧重于保持证据覆盖率,在LLaVA-1.5和Qwen2-VL等各种模型上,以最小的准确率损失实现了校准的改进。相比之下,基于注意力的修剪方法有时会导致准确率下降和过度自信增加。

  12. RESEARCH · CL_154057 ·

    LLM KV缓存管理:安全威胁与效率创新

    研究人员正在探索管理大型语言模型(LLM)中关键值(KV)缓存的新方法,这对于推理速度至关重要,但会随着上下文长度线性增长。一种方法,“通过随机设计实现KV缓存驱逐的误差证书”,提出使用随机驱逐策略来提供误差界限并改进故障归因,在降低预算的情况下几乎免费地获得性能提升。相比之下,“HijackKV”识别出位置无关KV缓存重用方面的一个新安全漏洞,其中受污染的KV数据可以以很高的成功率悄悄地劫持模型行为。第三种方法,“SelKV”,提供…

  13. RESEARCH · CL_148712 ·

    Gemma-4 模型已移植到 AWS Inferentia2 加速器

    作者成功将包括密集型和专家混合(MoE)变体在内的整个 Gemma-4 模型家族移植到 AWS Inferentia2 加速器上运行。这需要大量手动工作,因为供应商提供的工具(如 optimum-neuron 和 Neuron vLLM)不支持 Gemma-4 的特定架构,例如 KV 共享和 MoE。该过程需要自定义跟踪和编译管道,其中 31B 密集型模型和 26B-A4B MoE 模型带来了独特的扩展和架构挑战。

  14. TOOL · CL_116105 ·

    现代 LLM Transformer 块通过 RMSNorm、GQA 和 MoE 演进

    大型语言模型 (LLM) 中的现代 Transformer 块已超越最初的 2017 年设计,以提高训练稳定性、上下文长度、推理效率和模型容量。关键的进步包括使用 RMSNorm 进行更简单、更稳定的归一化,使用分组查询注意力 (GQA) 和旋转位置嵌入 (RoPE) 来优化注意力机制,以及在前馈网络中使用 SwiGLU 或专家混合 (MoE) 来增强表达能力和容量。这些修改解决了关键的扩展挑战,使大规模 LLM 的开发和部署更加实用。

  15. RESEARCH · CL_115129 ·

    开源AI中Transformer注意力机制的演进

    自诞生以来,Transformer架构的注意力机制经历了显著的演进,众多创新为更高效、更强大的大型语言模型做出了贡献。FlashAttention、多查询注意力(MQA)、分组查询注意力(GQA)和滑动窗口注意力(SWA)等创新极大地降低了内存需求并提高了推理性能。最新的进展,包括门控Delta网络(GDNs)等线性注意力变体和原生稀疏注意力(DSA)等稀疏注意力方法,正在进一步拓展边界,许多开源模型都采用了这些技术。

  16. TOOL · CL_115074 ·

    KV Cache 内存解析:估算和减少 LLM 中的 VRAM 使用量

    KV Cache 是 LLM 推理的关键组成部分,会消耗大量 VRAM,尤其是在更长的上下文长度或更大的批处理大小时,其占用内存常常超过模型权重所需的内存。一个简单的公式可以估算 KV Cache 内存:2 × layers × hidden_dim × context_length × bytes_per_param。例如,Llama 3.1 70B 在 128K 上下文下,其 KV Cache 需要 340GB。像多查询注意力(M…

  17. RESEARCH · CL_111257 ·

    PersistentKV通过新的调度技术优化商品GPU上的LLM服务

    一篇新论文介绍PersistentKV,一个旨在优化长上下文大语言模型(LLM)在商品GPU上服务的系统。PersistentKV采用页感知解码调度和原生块表注意力引擎来减少KV缓存碎片并提高吞吐量。与FlashInfer等现有方法相比,该系统在某些工作负载上展示了高达1.4倍的性能提升,并将工作分配确定为LLM服务效率的关键因素。

  18. TOOL · CL_105112 ·

    Kamera方法通过位置不变KV缓存增强多模态AI效率

    研究人员开发了一种名为Kamera的新方法,解决了多模态AI代理重复编码来自重复视频帧或UI屏幕截图的信息的效率低下问题。该技术引入了一个无训练的、低秩的条件化patch,以及无位置的块,从而恢复了在朴素KV缓存重用过程中丢失的跨块绑定。通过实现精确的RoPE重新旋转和patch恢复,Kamera显著降低了重新排序、滑动窗口生存和召回等操作的重新计算成本,同时保持了任务准确性并最小化了KV占用空间。

  19. RESEARCH · CL_105983 ·

    分组查询专家通过选择性激活查询头来增强 Transformer 的效率

    研究人员引入了分组查询专家 (GQE),这是一种新颖的专家混合层,旨在提高 Transformer 模型(尤其是在长上下文长度下)的效率。GQE 在分组查询注意力 (GQA) 的基础上,为每个 token 选择性地激活查询头专家,而不是统一应用所有头。这种方法在保持 GQA 的 KV 缓存优势的同时,显著减少了激活查询头的计算量。在实验中,GQE 在 300 亿 token 的预算和 2.5 亿参数规模下,实现了与标准 GQA 基线相…

  20. TOOL · CL_95483 ·

    xFormers 库可在 GPU 上实现内存高效的 Transformer 模型

    本教程演示了如何使用 xFormers 库在 GPU 上构建内存高效的 Transformer 模型。它涵盖了实现和比较内存高效注意力与标准注意力,分析了因果掩码、打包序列、分组查询注意力 (GQA) 和 ALiBi 位置偏差等技术。该指南还展示了如何将这些方法结合到一个可训练的 GPT 风格模型中,该模型利用 xFormers 注意力和 SwiGLU 前馈层进行自动混合精度训练。