PulseAugur
实时 17:35:51
实体 SnapKV

SnapKV

PulseAugur coverage of SnapKV — every cluster mentioning SnapKV across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_167283 ·

    新框架将语言模型记忆驱逐重塑为估计问题

    研究人员引入了一个新的语言模型工作记忆管理框架,将驱逐决策视为一个估计问题。这种方法被称为“驱逐即估计”,旨在通过考虑存储项未来重用的可能性来优化内存使用。一种名为 RMM 的提议策略是对 StreamingLLM 和 H2O 等现有方法的泛化,在标准基准测试上表现相当,但在内存重用更可预测和内生时显示出潜在优势。

  2. RESEARCH · CL_151862 ·

    新研究致力于 LLM KV 缓存优化以提高效率 · 已追踪 10 个来源

    近期研究论文引入了优化大型语言模型中 KV 缓存管理的新技术,解决了内存瓶颈并提高了推理效率。vToken、GCache、LinearKV、KVDiagnosis、SemPIC、SPECTRA、CommitKV、RippleKV、CoinRAG 和 GraceKV 等方法提出了各种策略,包括令牌级虚拟化、全局影响缓存、与位置无关的缓存、诊断基准测试、语义缓存、谱变换编码、生命周期感知压缩和全局资源分配。这些方法旨在减少内存使用量、加速…

  3. RESEARCH · CL_139599 ·

    新方法旨在提高 LLM KV 缓存压缩效率

    研究人员正在开发先进的技术来压缩大型语言模型 (LLM) 的键值 (KV) 缓存,这是推理过程中内存成本的主要贡献者。JoLT 和 FlashJoLT 等新方法利用张量分解和残差分配,在性能损失极小的情况下实现了显著压缩,如在 Mistral-7B-v0.3 和 Llama 2 13B 等模型上所证明的。其他研究探讨了查询可见性如何影响压缩方法的排名,一些方法在事先不知道查询的情况下表现不佳。此外,PM-KVQ 和 REAL 等方法旨…

  4. RESEARCH · CL_106564 ·

    新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源

    多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。

  5. RESEARCH · CL_93251 ·

    新的LLM KV缓存压缩方法应对安全性和效率挑战

    研究人员正在开发新的方法来压缩大型语言模型(LLM)中的键值(KV)缓存,以减少内存使用并提高推理效率。AnchorKV通过偏向于不保留有害提示的token来关注安全性,而PolyKV通过对不同的Transformer层应用不同的策略和预算来优化压缩。Tangram在服务框架中实现了实用的非均匀KV缓存压缩,而BACON通过结合观察窗口注意力和最后查询证据来增强多模态KV缓存压缩。此外,TurboQuant和OSCAR代表了KV缓存量…

  6. TOOL · CL_38307 ·

    KV 缓存驱逐保护比评分更重要

    研究人员开发了一种管理大型语言模型中 KV 缓存驱逐的新方法,发现结构性保护比评分算法更关键。他们对 Transformer 模型的研究表明,如果没有保护,现有的驱逐策略会显著退化。通过为结构性保护保留一小部分缓存,模型即使在缓存大小有限的情况下,也能恢复相当数量的原始质量。