实体
Locks
Locks
PulseAugur coverage of Locks — every cluster mentioning Locks across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的 LOCKS 方法将 LLM 在 1M 上下文下的 KV 缓存读取量大幅削减
一种名为 LOCKS 的新方法已被开发出来,旨在显著减少大型语言模型中的内存带宽瓶颈,尤其是在上下文长度达到一百万个 token 时。传统方法难以应对从 GPU 高带宽内存传输的海量 KV 缓存。LOCKS 通过使用每页奇异值分解 (SVD) 来创建键向量的紧凑摘要,从而使模型能够在不加载完整 KV 缓存的情况下估算页面相关性,以此来解决这一问题。据称,这种方法在结构上是可靠的,与以往依赖固定共享基数的方法不同。
-
新的LOCKS方法显著降低了LLM长上下文解码延迟
研究人员开发了一种名为LOCKS(页面局部紧凑键摘要)的新方法,以提高大型语言模型长上下文解码的效率。该技术通过为每个上下文页面创建谱摘要来解决由键值(KV)缓存引起瓶颈,使模型能够仅关注最相关的页面。LOCKS在包括LongBench-v1、RULER、AIME26和MATH-500在内的各种基准测试中表现强劲,即使显著减少了对令牌的关注,也能保持高质量。该方法可作为vLLM的即插即用插件使用,可大幅降低解码延迟和KV缓存大小。