KV cache
PulseAugur coverage of KV cache — every cluster mentioning KV cache across labs, papers, and developer communities, ranked by signal.
- used by graphics processing unit 90%
- used by vLLM 90%
- used by large-language models 90%
- uses TurboQuant 90%
- used by GQA 90%
- used by TurboQuant 90%
- used by Mingxin FX100 90%
- used by Prompt Caching for Token Efficiency 90%
- instance of SnapKV 90%
- used by Grouped Query Attention 90%
- used by Oscar 90%
- instance of ruler 90%
28 天有情绪数据
-
分析发现 LLM 中的 KV 缓存错误不影响首次解码步骤
一项技术分析显示,LLM KV 缓存实现的常见错误不会影响缓存首次解码步骤的准确性。作者通过广泛的 JavaScript 测试表明,输出的偏差并非由于缓存实现错误,而是其他因素,例如在使用较低精度累加器时求和的归约顺序。分析表明,感知到的不准确性常常被错误地归因于 KV 缓存本身,而实际上,在大多数常见配置中,缓存仍然是位精确的。
-
Mamba-3 架构解决了逻辑失败和 KV 缓存问题
Mamba-3 架构已推出,其特点是数据依赖的旋转位置嵌入 (data-RoPE) 和其他先进技术,以解决序列建模中的局限性。据报道,这种新架构在形式逻辑任务上达到了完美的准确率,相比之前的线性模型有了显著改进,并消除了困扰 Transformer 模型的 KV 缓存内存开销。Mamba-3 在处理长上下文窗口方面也表现出优于 Transformer 基线模型的性能,这对于新兴的代理 AI 工作流至关重要。
-
大语言模型推理优化:理解 KV 缓存
KV 缓存是大语言模型(LLM)推理的关键优化技术,可显著减少自回归文本生成过程中的冗余计算。通过存储先前处理过的 token 的 Keys 和 Values,KV 缓存将矩阵-矩阵乘法转变为更高效的矩阵-向量乘法。这项优化对于理解大语言模型的计算-内存权衡至关重要,因为它增加了内存带宽需求,并与模型权重争夺显存(VRAM),从而影响整体吞吐量和服务成本。
-
将 LLM 中的 KV 缓存视为可导航向量空间以实现高效注意力
大型语言模型中的 KV 缓存可以被概念化为一个高维向量空间,而不是一个简单的扁平列表。这种几何结构允许通过将注意力视为相似性搜索来实现高效检索。通过组织查询并将其路由到该空间内的特定区域,可以执行局部注意力,从而优化访问相关上下文的过程。
-
Qwen3.8-27B-Q6_K 质量受 KV 缓存量化影响
Reddit r/LocalLLaMA 子版块的一位用户观察到,KV 缓存的量化级别显著影响 Qwen3.8-27B-Q6_K 模型响应的质量。具体来说,与使用 Q4 或混合 Q8/Q4 量化相比,使用 Q8 量化 KV 缓存产生了更深思熟虑、更高质量的输出。
-
Kimi K3模型通过新的注意力机制突破长上下文和深度瓶颈 · 已追踪2个来源
Moonshot的Kimi K3模型解决了极长上下文窗口和深度神经网络的挑战。为了处理长达一百万个token的上下文窗口,Kimi K3采用了Kimi Delta Attention (KDA),它将历史信息压缩成固定大小的状态,而不是像标准注意力那样存储单独的键值对。这种方法解决了序列长度增加带来的计算成本不断上升的问题。此外,该模型还引入了Attention Residuals,一种学习每一先前层贡献的机制,防止有用表示在模型深度中丢失。
-
计算、内存和存储领域探索LLM首次响应时间缩减策略
减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…
-
KV 缓存缺陷破坏语言代理回滚一致性
arXiv 上的一篇新研究论文详细介绍了一个与 KV 缓存保留相关的语言代理中的关键漏洞,该漏洞可能导致回滚不一致。这意味着,即使应用程序认为它已丢弃某些信息,模型仍可能由于残留的 KV 状态而保留并关注这些信息。研究人员在多个开源模型上展示了这个问题,并发现即使使用 Hugging Face Transformers 和 LangGraph 等标准工具也可以重现。他们提出了一种通过事务本地缓存恢复来解决此问题的方案,以弥补此状态完整性漏洞。
-
GraniKV 通过非对称KV缓存分页提升AI多智能体吞吐量
研究人员开发了GraniKV,一种新颖的KV缓存分页系统,旨在提高多智能体AI系统的效率,特别是那些具有长共享前缀的系统。GraniKV采用非对称粒度方法,将共享前缀连续分配,并将每个请求的后缀进行细粒度分配。该系统集成了调度器,根据工作负载特性选择最佳后端,从而在现有生产基线之上实现了显著的吞吐量提升。例如,GraniKV在Llama-3.1-8B上实现了高达2.16倍的输出令牌吞吐量,并在传统方法表现不佳的异构多智能体服务场景中展…
-
复现StreamingLLM产生零结果,凸显模型学习到的行为
一项试图复现大型语言模型StreamingLLM技术的尝试,该技术声称通过保留固定数量的初始token在KV缓存中来提高性能,但并未产生任何可辨别的影响。作者使用随机查询/键对进行的实验表明,当模型学习到的行为不存在时,StreamingLLM的所谓好处也随之消失。这表明StreamingLLM的有效性与其模型学习到的路由机制有关,而不是token位置的几何属性。
-
KV 缓存大小挑战 LLM 推理效率
KV 缓存是高效 LLM 推理的关键组成部分,它存储每个 token 的键值向量以避免重新计算。该缓存的体积可能比模型权重本身大得多,尤其是在上下文窗口较长的情况下,这会导致巨大的 GPU 内存需求。优化 KV 缓存的传输和管理对于降低推理延迟和成本至关重要,vLLM 和 DeepSpeed 等工具提供了潜在的改进方案。
-
GraniKV系统为多代理AI服务优化KV缓存
研究人员开发了GraniKV,这是一种新颖的KV缓存层,旨在优化具有长共享前缀的多代理系统的服务引擎。该系统采用非对称分页粒度,将共享前缀连续分配,并将每个请求的后缀进行细粒度分配。GraniKV集成了级联注意力机制和一个根据工作负载需求选择最佳后端的调度器。该系统在Llama-3.1-8B和Qwen-2.5系列等模型上展示了显著的吞吐量提升,最高可达生产基线的2.16倍。
-
KV 缓存和 PagedAttention 优化现有 GPU 上的 LLM 推理
由于内存碎片化和重新计算,大规模语言模型推理在规模化时可能效率低下。源自开源引擎 vLLM 的 KV 缓存和 PagedAttention 等技术旨在优化推理过程中的 GPU 内存使用。KV 缓存存储先前计算的键值矩阵,以避免在解码阶段进行冗余计算,而 PagedAttention 通过更有效地管理碎片化内存来进一步增强这一点,从而提高吞吐量并降低延迟。
-
vLLM 对比 Ollama:LLM 的生产部署
vLLM 和 Ollama 是用于部署大型语言模型的不同工具,各自针对不同的用例进行了优化。Ollama 在本地、单用户交互方面以简洁性见长,易于在个人机器上快速运行模型。相比之下,vLLM 专为高吞吐量的生产环境设计,通过 PagedAttention 和连续批处理等高级技术,能够高效地服务数百名并发用户。基准测试表明,在高度并发的情况下,vLLM 的性能显著优于 Ollama,每秒处理的令牌数几乎是 Ollama 的 20 倍,同…
-
LiveAnimate 实现实时、稳定的长篇幅人体动画
研究人员开发了 LiveAnimate,一个能够实时生成稳定、长篇幅人体动画的新颖系统。该系统利用一个拥有140亿参数的视频扩散 Transformer,并通过 Reference-Anchored Teacher-Forcing Adaptation 和 Block-wise Self-Forcing Distillation 等专门的训练技术进行增强,以实现三步采样预算。为了在不增加计算负载的情况下保持长时间的视觉一致性,Live…
-
AI 代理易受 KV 缓存投毒攻击
一项新的技术分析揭示了有状态 AI 代理中存在的重大安全漏洞,特别是关于键值(KV)缓存。攻击者可以利用此内存执行间接提示注入和缓存投毒,成功率很高,能够劫持代理功能。该论文提出了架构性变更,包括 QSAF 运行时可观测性和无状态内存环设计,以减轻这些风险并防止 AI 系统的认知退化。
-
理解大型语言模型协议中的“零数据保留”
“零数据保留”(Zero Data Retention, ZDR)并非行业标准化术语,缺乏正式定义或认证。其含义因提供商而异,承诺内容常在数据类型、特定端点、保留目的和持续时间等方面存在差异。关键区别包括承诺是否涵盖数据保留、训练使用、内容与元数据对比,以及约束方和地点的范围。
-
ImpactHO 通过注意力感知 KV 缓存传输改进边缘 LLM 交接
研究人员开发了一种名为 ImpactHO 的新颖方法,以提高大型语言模型 (LLM) 在边缘节点之间传输键值 (KV) 缓存的效率。该方法优先传输 KV 缓存最重要的部分,而不是发送整个缓存,这可能导致在同时进行用户交接时网络带宽饱和。通过按重要性对缓存条目进行排序并传输一小部分信息量最大的数据,ImpactHO 旨在严格的传输窗口内保持推理连续性并最大化用户的平均准确率。
-
LLM 服务器内存核算:为最大输出预留,而非仅为提示
一篇技术博文解释了如何通过正确核算 KV 缓存使用量来防止 LLM 服务器因内存问题而崩溃。关键的见解是,内存预留应基于最大潜在输出令牌(提示 + max_tokens 上限),而不仅仅是当前提示的长度。这种方法可以防止当许多具有大生成上限的请求重叠时发生的间歇性内存不足错误。该博文还建议实现 Retry-After 标头,在请求因资源不足而被拒绝时,向客户端发出退避信号。
-
新的MISA-T策略提高了LLM的RL rollout效率
研究人员开发了MISA-T,这是一种新的路由层准入策略,旨在优化大型语言模型(LLM)的混合强化学习(RL)rollout调度。该策略解决了不同RL范式(如RLVR和RLHF)争夺KV缓存容量的异构服务需求带来的挑战。MISA-T通过智能管理会话准入、KV容量分配和KV核算,同时保持指定的混合工作负载和任务分数,从而提高了rollout吞吐量并缩短了迭代时间。