KV caching
PulseAugur coverage of KV caching — every cluster mentioning KV caching across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的 Hydration Proxy 模式解决了无状态 LLM API 的挑战
一篇新研究论文介绍了一种名为 Hydration Proxy 模式的架构解决方案,用于管理无状态 LLM API 中的对话状态。该模式将会话持久化与推理引擎解耦,允许客户端应用程序卸载管理对话内存的负担。所提出的框架旨在让平台能够控制其数据,同时实现安全的语义基础,并通过 Context Stabilization Mandate 解决状态管理与 KV 缓存之间的权衡。
-
Ripple-Pivot Search 将 Diffusion LLM 推理速度提高了 18 倍
研究人员推出了一种名为 Ripple-Pivot Search (RPS) 的新型扩散大型语言模型 (dLLM) 解码方法,该方法显著加快了推理速度。RPS 利用一种“涟漪效应”,即早期确定中间熵位置可以降低后续位置的不确定性,从而实现更快的并行解码。该方法在推理和代码生成任务上比标准解码器快 4-10 倍,与 KV 缓存结合使用时,有潜力将速度提高高达 18 倍,同时保持生成质量。
-
Diffusion language models research tackles efficiency and confidence gaps · 6 sources tracked
近期研究探索了提高扩散语言模型(DLM)效率和有效性的方法。一篇论文研究了在解码过程中何时真正需要无分类器引导(CFG),认为其益处是特定于提示的,并且通常集中在过程的早期。另一项研究介绍了 Archer,一种无需训练的 KV 缓存方法,通过自适应地重用提示隐藏状态来加速 DLM 中的回滚能力。进一步的研究解决了 DLM 中的“表示-置信度差距”问题,即内部准确性信号与外部置信度分数不一致,并提出了一个轻量级工具来改进答案排名。此外,…
-
Comprehension Memory 大幅降低 LLM 上下文成本,提升效率
一篇新论文介绍了 Comprehension Memory (CoMem) 技术,该技术旨在显著降低长上下文语言模型相关的内存和计算成本。CoMem 的工作原理是在“分割层”缓存中间层状态,而不是存储所有层的完整 KV 缓存。这种方法可以实现更快的推理速度和急剧降低的 VRAM 使用量,以 128k token 仅需 18.26 GB 的占用空间为例,相比之下通常需要 89 GB。该方法在 Qwen3_8B 模型上进行了测试,在保持准…
-
新的MM-ShiftKV方法优化多模态LLM的KV缓存
研究人员开发了MM-ShiftKV,一种用于优化多模态大语言模型(MLLM)中键值(KV)缓存的新颖方法。该技术解决了预填充阶段KV选择方法(基于预填充统计数据估算KV重要性)在多模态推理期间表现不佳的问题,因为解码时查询的方差很大。MM-ShiftKV是一种无需训练的方法,它通过使用方差扩展查询代理来近似预填充期间的解码时查询行为。然后,它根据聚合的注意力质量来估算提示KV的重要性,在严格的KV缓存预算下,在多模态基准测试中始终优于现有方法。
-
苹果研究人员通过新的解码技术推进扩散语言模型
苹果的机器学习研究部门发表了几篇论文,详细介绍了扩散语言模型(dLLMs)的进展。与自回归模型相比,这些模型通过并行解码多个 token,有可能实现更快的推理。研究包括探索用于口语模型的连续扩散、通过残差上下文扩散(RCD)提高 dLLM 的效率,以及使用强化学习训练解遮蔽策略。其他工作则侧重于通过专家产品(PoE)等技术弥合扩散模型和自回归模型之间的差距,并开发统一不同解码策略的混合模型。
-
新的扩散模型可在消费级硬件上实现实时人工智能音乐生成
研究人员开发了实时音乐扩散模型(LMDMs),这是一种使用扩散模型进行交互式音乐生成的新方法,可以在消费级硬件上运行。LMDMs 通过块状 KV 缓存优化推理效率,并引入 ARC-Forcing 以在没有显式强化学习的情况下实现稳定的训练后对齐,从而改进了现有方法。这些模型已在各种创意应用中得到演示,包括文本条件生成、基于草图的合成以及实时艺术家-AI 协作,充当“生成延迟”以通过可变的音色效果转换即兴创作。
-
LLM KV缓存详解:速度与内存的权衡
大型语言模型利用KV缓存来加速推理,通过存储先前计算出的键(key)和值(value)向量,而不是为每个新令牌重新计算它们。该技术在初始、计算密集型的“预填充”(prefill)阶段(缓存构建时)之后,显著加快了令牌生成速度。然而,KV缓存以增加内存使用量为代价来减少计算量,缓存大小随上下文长度线性增长,并且在大规模部署时可能超过模型权重。
-
Stochastic KV Routing enables adaptive depth-wise cache sharing for LLMs
研究人员开发了一种名为 Stochastic KV Routing 的新方法,以减小 Transformer 语言模型的内存占用。该技术通过训练层随机关注先前层的 KV 状态,从而实现自适应的深度缓存共享。评估表明,该方法可以在不牺牲性能的情况下显著降低内存需求,甚至可以在数据受限的情况下充当一种正则化方法。