PulseAugur
实时 15:12:41
English(EN) SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKV 框架优化大语言模型(LLM)KV 缓存,提升速度和质量

研究人员开发了一个名为 SelKV 的新颖框架,以解决大语言模型(LLM)中因键值(KV)缓存随上下文长度线性增长而导致的内存瓶颈问题。这种无需训练的方法采用双组分方法:一个软余弦门,根据语义相似性选择性地合并或丢弃 token;以及一个注意力比例补偿机制,以纠正合并引入的注意力不平衡。在仅使用 25% KV 缓存的 LongBench 基准测试上进行评估时,SelKV 表现强劲,尤其是在分组查询注意力(GQA)模型上,并在 100k token 时实现了 3.3 倍的解码速度提升,甚至在复杂的问答任务上超越了全缓存基线。 AI

影响 通过减少内存占用和提高解码速度来优化大语言模型(LLM)推理,可能支持更长的上下文窗口和更快的响应。

排序理由 详细介绍优化大语言模型(LLM)KV 缓存新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

SelKV 框架优化大语言模型(LLM)KV 缓存,提升速度和质量

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur ·

    SelKV:具有逐令牌合并或丢弃和注意力补偿的选择性KV缓存合并

    arXiv:2607.16213v1 Announce Type: new Abstract: Large Language Models (LLMs) generate text autoregressively, relying on a key-value (KV) cache whose memory footprint grows linearly with context length, creating a major bottleneck. Recent compression methods mitigate this cost via…