实体
Vishesh Tripathi
Vishesh Tripathi
PulseAugur coverage of Vishesh Tripathi — every cluster mentioning Vishesh Tripathi across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的分组值注意力方法大幅缩减 Transformer KV 缓存大小
研究人员推出了一种新颖的方法——分组值注意力(GVA),以减小 Transformer 模型中 KV 缓存的内存占用。GVA 存储分组值,并使用学习到的线性映射来重建键,该键可以在推理过程中集成到查询中。该方法旨在将性能保持在接近分组查询注意力(GQA)的水平,同时显著减小缓存大小,据报道,持久缓存标量减少了 45-47%。该方法以更紧凑的缓存表示实现了接近 GQA 的基准准确性,并且正在开发自定义解码内核以实现更快的推理。
-
分组查询专家通过选择性激活查询头来增强 Transformer 的效率
研究人员引入了分组查询专家 (GQE),这是一种新颖的专家混合层,旨在提高 Transformer 模型(尤其是在长上下文长度下)的效率。GQE 在分组查询注意力 (GQA) 的基础上,为每个 token 选择性地激活查询头专家,而不是统一应用所有头。这种方法在保持 GQA 的 KV 缓存优势的同时,显著减少了激活查询头的计算量。在实验中,GQE 在 300 亿 token 的预算和 2.5 亿参数规模下,实现了与标准 GQA 基线相…