SnapKV
PulseAugur coverage of SnapKV — every cluster mentioning SnapKV across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
WakeKV 为 LLM 引入反应式 KV 缓存驻留
研究人员开发了 WakeKV,这是一种新颖的 KV 缓存驻留策略,旨在提高大型语言模型的效率。与固定头分类的现有方法不同,WakeKV 会动态地将生成过程中行为发生变化的头移动到可恢复的 CPU 存储库中。这种反应式方法在各种模型和任务中持续提高性能,在内存受限的情况下优于 SnapKV 和 ReasonAlloc 等方法。
-
新研究优化LLM的KV缓存使用,提高效率和准确性
近期研究探讨了优化大型语言模型(LLM)中KV缓存使用的方法,特别是在长上下文和智能体系统方面。一篇论文提出了一种针对文档编辑后陈旧KV缓存的预算修复策略,发现连续的、与编辑相关的局部窗口非常有效,并且比完全重新预填充快得多。另一项研究介绍了Fathom技术,该技术允许查询动态决定读取多少KV缓存,从而提高解码速度并减少大型模型的注意力误差。第三篇论文研究了KV缓存逐出对自回归生成的影响,分析了发散时间和累积不匹配,发现某些逐出策略会…
-
LLM代理百万token上下文成本分析:内存带宽是关键
长上下文LLM代理生成token会因访问缓存token的计算需求而产生显著成本。主要瓶颈是内存带宽,因为模型必须读取所有先前缓存的token来计算注意力分数,即使只有少数相关。缓解这些成本的策略包括流式LLM(StreamingLLM)和SnapKV等逐出方法、用于降低存储精度的量化技术以及用于缩短输入文本的提示压缩。
-
新框架将语言模型记忆驱逐重塑为估计问题
研究人员引入了一个新的语言模型工作记忆管理框架,将驱逐决策视为一个估计问题。这种方法被称为“驱逐即估计”,旨在通过考虑存储项未来重用的可能性来优化内存使用。一种名为 RMM 的提议策略是对 StreamingLLM 和 H2O 等现有方法的泛化,在标准基准测试上表现相当,但在内存重用更可预测和内生时显示出潜在优势。
-
新研究致力于 LLM KV 缓存优化以提高效率 · 已追踪 10 个来源
近期研究论文引入了优化大型语言模型中 KV 缓存管理的新技术,解决了内存瓶颈并提高了推理效率。vToken、GCache、LinearKV、KVDiagnosis、SemPIC、SPECTRA、CommitKV、RippleKV、CoinRAG 和 GraceKV 等方法提出了各种策略,包括令牌级虚拟化、全局影响缓存、与位置无关的缓存、诊断基准测试、语义缓存、谱变换编码、生命周期感知压缩和全局资源分配。这些方法旨在减少内存使用量、加速…
-
新方法旨在提高 LLM KV 缓存压缩效率
研究人员正在开发先进的技术来压缩大型语言模型 (LLM) 的键值 (KV) 缓存,这是推理过程中内存成本的主要贡献者。JoLT 和 FlashJoLT 等新方法利用张量分解和残差分配,在性能损失极小的情况下实现了显著压缩,如在 Mistral-7B-v0.3 和 Llama 2 13B 等模型上所证明的。其他研究探讨了查询可见性如何影响压缩方法的排名,一些方法在事先不知道查询的情况下表现不佳。此外,PM-KVQ 和 REAL 等方法旨…
-
新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源
多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。
-
新的LLM KV缓存压缩方法应对安全性和效率挑战
研究人员正在开发新的方法来压缩大型语言模型(LLM)中的键值(KV)缓存,以减少内存使用并提高推理效率。AnchorKV通过偏向于不保留有害提示的token来关注安全性,而PolyKV通过对不同的Transformer层应用不同的策略和预算来优化压缩。Tangram在服务框架中实现了实用的非均匀KV缓存压缩,而BACON通过结合观察窗口注意力和最后查询证据来增强多模态KV缓存压缩。此外,TurboQuant和OSCAR代表了KV缓存量…
-
KV 缓存驱逐保护比评分更重要
研究人员开发了一种管理大型语言模型中 KV 缓存驱逐的新方法,发现结构性保护比评分算法更关键。他们对 Transformer 模型的研究表明,如果没有保护,现有的驱逐策略会显著退化。通过为结构性保护保留一小部分缓存,模型即使在缓存大小有限的情况下,也能恢复相当数量的原始质量。