PulseAugur
中
实时 00:02:51
实体 GQA

GQA

PulseAugur coverage of GQA — every cluster mentioning GQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
39
90 天内 39
发布 · 30天
0
90 天内 0
论文 · 30天
29
90 天内 29
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/3 页 · 共 44 条
  1. TOOL · CL_286867 ·

    新的CHASE框架通过几何感知方法增强AI模型工程

    研究人员推出了一种新颖的几何感知模型工程框架CHASE(Channel-Aligned Structure Exploitation)。CHASE利用几何和光谱对齐(GSA)来分析已训练的神经网络,识别可应用于模型修改、重构和压缩的结构属性。该论文详细介绍了六种应用,包括参数高效微调、结构化剪枝补偿和模型合并,实验结果证明了CHASE在这些任务中的有效性。

  2. RESEARCH · CL_280363 ·

    新方法有望通过稀疏注意力和权重近似加速大语言模型解码

    两篇新研究论文提出了加速大语言模型(LLMs)解码过程的方法。第一篇论文介绍了稀疏非对称分组查询注意力(SAGA),它减少了键头的数量,同时保留了更多的价值头以提高效率,实现了2倍以上的加速,且质量损失极小。第二篇论文SpAx通过结合激活稀疏性和权重近似来解决在内存有限的硬件上部署LLMs的挑战,当权重被卸载到CPU内存或闪存时,可以显著加速。

  3. TOOL · CL_273407 ·

    新的NAMOH稀疏注意力机制可实现LLM上下文的高效扩展

    研究人员推出了一种新颖的稀疏注意力机制NAMOH,旨在提高大型语言模型的效率和有效性,尤其是在扩展上下文长度方面。NAMOH通过每个token仅激活一部分注意力头来实现这一点,每个头处理token的特定子序列。这种方法允许参数扩展直接实现上下文扩展,在计算成本降低的同时,可能优于同等参数数量的密集模型。该机制与Grouped-Query Attention (GQA) 等现有技术和其他稀疏注意力方法兼容。

  4. TOOL · CL_257220 ·

    新方法验证多模态大语言模型中的物体声明

    研究人员开发了一种名为语义空间一致性验证(SSAV)的新型无训练方法,以解决多模态大语言模型中的物体幻觉问题。该技术通过评估物体声明在不同查询下的稳定性及其在图像区域内的持续定位来验证这些声明。SSAV结合了语义支持估计和查询诱导区域验证(QIRV),以降低对措辞的敏感性并识别不可靠的物体提及。实验表明,SSAV能有效减轻幻觉,在COCO、A-OKVQA和GQA等基准测试中提高了准确性,同时在应用于LLaVA-1.5-7B等模型时降低…

  5. TOOL · CL_257210 ·

    新的Relation-Orbit方法增强了VLM空间声明的验证能力

    研究人员开发了一种名为Relation-Orbit的新方法,用于提高视觉语言模型(VLM)在验证涉及空间关系(如左右区分)的声明时的准确性。该技术聚合了从水平反射等干预中获得的似然度量,以创建更强大的验证信号。在VSR和GQA等数据集上,使用包括LLaVA-1.5在内的各种冻结VLM进行的评估表明,Relation-Orbit在受控风险水平下的覆盖率方面优于现有基线。

  6. TOOL · CL_254425 ·

    新的隐私防御方法用于修剪视觉语言模型的视觉标记

    研究人员开发了 QPriv-VL,一个旨在增强用于联邦学习等敏感应用的视觉语言模型(VLM)隐私的新框架。该系统在传输前智能地修剪视觉标记,从而降低数据传输成本并减少暴露私人信息的风险。QPriv-VL 使用动态阈值预测器(DTP),该预测器考虑问题相关性和特征敏感性,以选择性地保留重要的视觉数据,同时抑制潜在的敏感区域,在传输的标记少得多的情况下实现了具有竞争力的准确性。

  7. TOOL · CL_253885 ·

    AI模型:理解MHA、MQA、GQA和MLA注意力机制

    本文深入探讨了AI模型中使用的各种注意力机制,特别关注多头注意力(MHA)、多查询注意力(MQA)、分组查询注意力(GQA)和多层注意力(MLA)。旨在阐明这些注意力设计的具体内容、它们的历史引入以及它们在不同AI模型中的当前应用。

  8. TOOL · CL_245614 ·

    新方法在证据退化情况下校准视觉语言模型置信度

    研究人员开发了一种方法,用于提高视觉语言模型(VLMs)在面对退化或不完整视觉证据时的可靠性。通过训练一个轻量级的事后可靠性头部,即使在关键部分视觉输入被逐步遮蔽的情况下,也能更好地校准模型对其答案的置信度。该方法旨在将证据顺序一致性与一般正确性分开,从而在挑战性条件下更细致地理解VLMs的性能。

  9. RESEARCH · CL_244631 ·

    3.8B LLM训练成本低于1000美元,挑战超大规模云服务商主导地位

    一个名为Little LM的38亿参数LLM,以低于1000美元的成本训练至0.384的CORE指标。这一成就挑战了只有大规模、数百万美元的运营才能进行有竞争力模型预训练的观念。该项目利用了分组查询注意力(GQA)等高效技术来最小化内存使用,并专注于高质量、经过筛选的数据,以在有限的预算内最大化训练过程的有效性。

  10. RESEARCH · CL_254718 ·

    新的分组值注意力方法大幅缩减 Transformer KV 缓存大小

    研究人员推出了一种新颖的方法——分组值注意力(GVA),以减小 Transformer 模型中 KV 缓存的内存占用。GVA 存储分组值,并使用学习到的线性映射来重建键,该键可以在推理过程中集成到查询中。该方法旨在将性能保持在接近分组查询注意力(GQA)的水平,同时显著减小缓存大小,据报道,持久缓存标量减少了 45-47%。该方法以更紧凑的缓存表示实现了接近 GQA 的基准准确性,并且正在开发自定义解码内核以实现更快的推理。

  11. RESEARCH · CL_235690 ·

    AI研究模仿人类视觉以实现高效视觉理解 · 2篇论文

    两篇新研究论文提出通过模仿人类中央凹视觉来更高效地进行视觉理解的方法。第一篇论文介绍了一种名为FAVE的可变分辨率ViT,它以高分辨率处理选定区域,同时保持原生几何结构,在物体识别和基于文本的视觉问答方面取得了改进,且计算资源显著减少。第二篇论文提出了一个数字中央凹管道,利用显著性驱动的注视和高分辨率观察,以传统密集预测方法一小部分的计算成本实现了实质性的语义理解。

  12. TOOL · CL_231607 ·

    新研究详解Transformer注意力中的“可扩展幂等性”

    研究人员在Transformer注意力机制中识别出一种特定的代数模式,称为“可扩展幂等性”。这种模式涉及有效OV算子的稀疏子集,它们在组合下几乎闭合,意味着将算子应用两次得到的结果与应用一次相似。跨多个模型和参数大小的实验表明,相当大比例的注意力头表现出这种闭合特性,而训练好的方向在实现这一点上起着至关重要的作用。研究进一步表明,虽然这种现象的几何容量广泛存在,但在训练好的模型中通常未被充分实现,而值的共享可以将这种头部的关系扩展到局部算子代数。

  13. TOOL · CL_231153 ·

    新理论将多头注意力视为参数识别

    一篇新发表在arXiv上的论文提出,Transformer模型中的多头自注意力机制可以被理解为一种参数识别策略。研究表明,拥有更多注意力头的模型在结构上具有更高的识别度,这意味着其更大比例的参数是唯一确定的。该论文还涉及了RoPE和GQA等现代Transformer改进,并阐述了它们如何提高这种参数识别率,并可能解释性能的提升。

  14. TOOL · CL_229130 ·

    新的GUIDE框架控制多模态模型证据使用

    研究人员推出了一种新颖的GUIDE框架,旨在控制大型多模态模型在遵循语言指令时如何利用内部证据。与可能依赖表面线索的先前模型不同,GUIDE在推理和生成过程中采用指令条件门控来调节证据通路。该框架已证明其能够在推理、分类和生成等各种多模态任务中诱导证据依赖性的结构化重新分配,同时保持任务性能。在GQA和TextVQA等数据集上的实验表明,GUIDE增强了对目标证据扰动的鲁棒性,并实现了证据来源的可控调制。

  15. SIGNIFICANT · CL_223593 ·

    Meta发布Muse Glimmer,一款用于高效本地运行的30B智能体模型

    Meta发布了Muse Glimmer,一个拥有300亿参数的多模态智能体模型,专为在本地高效运行而设计,并支持128K上下文窗口。该模型采用混合注意力机制,结合了局部注意力(处理邻近token)和全局注意力(处理更广泛的上下文),显著降低了KV缓存需求。它还采用了先进的量化技术,使其能够在24GB显存内运行,同时最大限度地减少性能损失。Muse Glimmer通过多阶段蒸馏过程进行训练,整合了推理轨迹和特定于智能体的数据,以实现本地…

  16. TOOL · CL_193652 ·

    新的TGIF模块可减少多模态大语言模型的幻觉

    研究人员开发了TGIF(文本引导的层间融合),这是一种旨在减少多模态大语言模型(MLLMs)幻觉的新型模块。与以往侧重于文本或静态视觉特征融合的方法不同,TGIF根据输入查询动态地融合来自视觉编码器不同层的视觉特征。这种方法无需更新视觉编码器,并且计算开销极小。当与LLaVA-1.5-7B集成时,TGIF在减少幻觉和提高OCR和VQA任务的性能方面表现出持续的改进,同时在ScienceQA和MMBench等其他基准测试上保持或提高了结果。

  17. COMMENTARY · CL_190013 ·

    KV 缓存成为 LLM 瓶颈,推动注意力变体创新

    KV 缓存是 LLM 自回归解码的关键组成部分,被确定为 2026 年前沿模型的主要瓶颈。其大小随上下文长度和批处理大小线性增长,使其成为比模型权重更主要的内存消耗者。缓解此瓶颈的技术包括减少 KV 头(MQA、GQA)、使用潜在表示压缩缓存(MLA)以及通过线性注意力或状态空间模型(SSMs)完全消除不断增长的缓存。2026 年的主流方法是混合模型,它将全注意力层与线性/SSM 层交织在一起,以平衡质量和内存效率。

  18. FRONTIER RELEASE · CL_182987 ·

    Liquid AI 发布 LFM2.5-2.6B:支持128K上下文的设备端智能体模型

    Liquid AI 发布了 LFM2.5-2.6B,这是一款开源权重、专为移动和边缘设备设计的设备端智能体模型。该模型拥有26.9亿参数,128,000个token的上下文窗口,并且无需依赖云API即可执行多步任务,包括规划和工具调用。Liquid AI 报告称,LFM2.5-2.6B 在指令遵循和工具使用基准测试中,与远大于自身的模型相比,表现具有竞争力,同时在各种硬件上保持了低内存使用和快速解码速度。

  19. TOOL · CL_180947 ·

    注视式探针揭示视觉基础模型中的局部信息

    研究人员开发了一种名为“注视式探针”(foveated probes)的新方法,以更好地评估冻结的视觉基础模型中保留的局部信息。与传统的全局图像嵌入不同,注视式探针使用学习到的或由问题驱动的查询来聚焦于特定的图像区域,模仿人类的视觉注意力。这种方法在需要识别特定对象属性(如颜色和形状)的任务中,尤其是在混乱条件下或处理反事实编辑时,比全局读出更有效。研究表明,这些模型中空间意识的明显局限性可能源于读出接口,而不是模型内部表征本身缺乏信息。

  20. TOOL · CL_177152 ·

    前沿大模型高精度提炼答案集编程理论

    一项新研究探索了使用神经符号方法从大型语言模型中提炼答案集编程(ASP)理论。该研究测试了九个模型,包括 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5 和 DeepSeek V4 Pro 等前沿模型,涵盖了 CLEVR、GQA 和 CLEVRER 三个基准。大多数前沿模型都取得了高精度,其中 Sonnet、Opus 和 DeepSeek V4 Pro 在 CLEVRER 上达到了 90% 以上的准确率…