实体
QKV attention
QKV attention
PulseAugur coverage of QKV attention — every cluster mentioning QKV attention across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
无键注意力机制将 Transformer KV 缓存内存减少 50%
研究人员推出了一种名为 Keyless Attention 的新颖机制,旨在提高 Transformer 架构的效率。该方法用专用的值空间路由投影取代了传统的键投影,消除了注意力计算中对键表示的需求。由此产生的仅值缓存可以将 KV 缓存内存和访问开销减少多达 50%,从而提高解码吞吐量。在各种模型和架构上的实验表明,Keyless Attention 在困惑度方面可媲美或超越标准的 QKV 注意力,并在下游任务上取得了有竞争力的性能。
-
无键注意力机制将KV缓存减半,提高Transformer效率
研究人员推出了一种新颖的Transformer注意力机制——无键注意力(Keyless Attention),该机制完全消除了键投影,仅基于查询(queries)和值(values)进行操作。与标准注意力相比,这种方法产生了一个仅值缓存(Value-Only Cache),将KV缓存内存和访问开销减半,同时保持或提高了解码吞吐量。该机制还实现了深度注意力因子分解(Depth-m Attention Factorization),实验表…