实体 Multi Head Latent Attention

Multi Head Latent Attention

PulseAugur coverage of Multi Head Latent Attention — every cluster mentioning Multi Head Latent Attention across labs, papers, and developer communities, ranked by signal.

Show in brief

总计 · 30天

90 天内 1

发布 · 30天

90 天内 0

论文 · 30天

90 天内 1

层级分布 · 90 天

主题

论文 1
模型发布 1

最近 · 第 1/1 页 · 共 1 条

RESEARCH · CL_45905 · May 23 · 13:14

新的MLA注意力机制将LLM KV缓存削减高达10倍

多头潜在注意力（MLA）是一种新颖的注意力机制，旨在显著压缩大型语言模型的KV缓存。通过将KV对投影到低维潜在空间，MLA实现了大量的缓存缩减，使DeepSeek-V2/V3和Kimi K2.x等模型能够以更少的内存处理更长的上下文和更大的批次。该技术改变了前缀缓存和注意力计算的实现方式，在模型推理过程中提供了内存使用和计算成本之间更有效的权衡。

新的MLA注意力机制将LLM KV缓存削减高达10倍