PagedAttention
PulseAugur coverage of PagedAttention — every cluster mentioning PagedAttention across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
LLM 服务拆分为两个阶段,GPU 通量加倍
现代 LLM 服务架构正通过将过程拆分为两个不同的阶段来更有效地处理请求:预填充(prefill)和解码(decode)。预填充阶段处理整个提示,是计算密集型的,受益于高 GPU 利用率。解码阶段负责逐个生成 token,是内存带宽密集型的,需要高效的 KV 缓存管理。PagedAttention、连续批处理(continuous batching)和分块预填充(chunked prefill)等创新对于优化这些阶段至关重要,而分离式…
-
PagedAttention和连续批处理革新大语言模型推理
大语言模型(LLM)服务基础设施在扩展推理方面面临严峻挑战,主要源于内存带宽和容量限制,而非原始计算能力。PagedAttention和连续批处理等关键创新,由vLLM等引擎率先推出,通过优化KV缓存的管理来解决这些问题。PagedAttention借鉴了操作系统虚拟内存的理念,将KV缓存划分为更小的块,将内存浪费从60%以上降低到4%以下,并提高了并发性。连续批处理通过在迭代级别处理请求,进一步提高了效率,避免了静态批处理和长时间等…
-
vLLM 抢占导致请求重启,增加延迟
vLLM 抢占问题发生在请求生成过程中 KV 缓存池可用块耗尽时,导致调度器驱逐正在进行的请求。在默认的 RECOMPUTE 模式下,这会丢弃请求的 KV 缓存,迫使其从头开始,从而导致显著的延迟峰值。此问题通常是由于允许的并发序列数量超过了 KV 池所能承受的范围,尤其是在输出长度较长的情况下。解决方案包括监控抢占计数、限制最大序列数量以及设置每个请求的 token 限制。
-
KV 缓存详解:大型语言模型如何管理上下文记忆以提高效率
KV 缓存是大型语言模型 (LLM) 中的一个关键组件,它存储先前生成 token 的键 (key) 和值 (value),从而避免在序列生成过程中进行冗余计算。这种缓存机制通过允许模型仅处理新 token 并从内存中读取过去上下文来显著提高效率。然而,KV 缓存的大小(由模型架构和上下文长度决定)可能会成为 GPU 内存的巨大消耗者,其大小甚至常常超过模型权重本身。像 PagedAttention 这样的技术旨在通过按需分配更小的内…
-
vLLM 内部:深入了解 LLM 推理请求生命周期
本文深入探讨了 vLLM 的内部工作原理,vLLM 是一个高吞吐量的 LLM 推理引擎。它追踪单个推理请求从初始 API 调用到进程间通信、调度,最终到 GPU 执行的全过程。解释重点关注 vLLM 0.22.0 的源代码,详细介绍了连续批处理、PagedAttention 以及调度和执行逻辑之间的分离等概念。
-
vLLM 的 PagedAttention 优化 LLM GPU 内存使用
vLLM 推出了 PagedAttention,这是一种管理大型语言模型 (LLM) GPU 内存的新颖方法,可显著减少浪费。传统的 LLM 服务框架通常会为键值 (KV) 缓存过度分配 GPU 内存,导致效率低下。PagedAttention 受操作系统虚拟内存的启发,将 KV 缓存划分为更小的块,允许它们非连续地存储在 GPU 内存中。这种方法可以缓解过度配置、内部碎片化和外部碎片化造成的内存浪费,有可能节省 60-80% 的 K…
-
使用 vLLM 自托管 LLM,云 GPU 成本节省 45%
本指南详细介绍了 2026 年在云 GPU 上使用 vLLM 自托管 LLM 的生产设置,旨在降低自主 AI 代理系统的成本。作者强调了 vLLM 相对于 TGI、SGLang 和 Ollama 等替代方案的优势,重点介绍了其 OpenAI 兼容 API、原生前缀缓存和结构化输出功能。讨论的关键技术包括用于高效 KV 缓存管理的 PagedAttention 和用于更快推理的 EAGLE-3 投机解码,成本分析表明 RunPod Co…
-
计算、内存和存储领域探索LLM首次响应时间缩减策略
减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…
-
KV 缓存和 PagedAttention 优化现有 GPU 上的 LLM 推理
由于内存碎片化和重新计算,大规模语言模型推理在规模化时可能效率低下。源自开源引擎 vLLM 的 KV 缓存和 PagedAttention 等技术旨在优化推理过程中的 GPU 内存使用。KV 缓存存储先前计算的键值矩阵,以避免在解码阶段进行冗余计算,而 PagedAttention 通过更有效地管理碎片化内存来进一步增强这一点,从而提高吞吐量并降低延迟。
-
vLLM 对比 Ollama:LLM 的生产部署
vLLM 和 Ollama 是用于部署大型语言模型的不同工具,各自针对不同的用例进行了优化。Ollama 在本地、单用户交互方面以简洁性见长,易于在个人机器上快速运行模型。相比之下,vLLM 专为高吞吐量的生产环境设计,通过 PagedAttention 和连续批处理等高级技术,能够高效地服务数百名并发用户。基准测试表明,在高度并发的情况下,vLLM 的性能显著优于 Ollama,每秒处理的令牌数几乎是 Ollama 的 20 倍,同…
-
vLLM:AI模型的高吞吐量推理引擎
vLLM 是一个开源的推理和服务引擎,旨在通过其 PagedAttention 机制优化 GPU 利用率。该工具因其处理大型语言模型的效率而受到关注。
-
压缩感知不适用于大语言模型推理存储压缩
由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。
-
KV Cache预取大幅降低LLM推理延迟
一种新的KV Cache数据预取策略已被开发出来,显著降低了大模型推理期间的存储延迟。该方法在明心FX100上使用480B模型进行了测试,推理吞吐量提高了40%,首个token的生成时间缩短了32%。该策略涉及在计算单元需要KV Cache块之前,将其从存储加载到更快的内存层级,这是随着上下文窗口扩展并超出GPU高带宽内存(HBM)容量而进行的关键优化。与KV Cache数据未命中时重新计算相比,这种方法提供了8.6倍到20倍的显著加速。
-
明玕 FX100 通过 KV Cache 复用提升 LLM 推理性能 · 追踪 2 个来源
明玕 FX100 在大型语言模型的多轮对话场景中展现了显著的性能提升。通过实施 KV Cache 复用策略(即将先前对话轮次的键值张量缓存起来,避免重新计算),该系统实现了 29-40% 的吞吐量提升和 26-32% 的首个 token 时间缩减。这些提升在冷启动或冷恢复情况下尤为显著,与重新计算整个历史记录的基线相比,系统可以将推理速度提高高达 20 倍。
-
大语言模型推理速度受硬件物理限制,而非模型复杂度
一篇文章探讨了大语言模型(LLM)推理的性能瓶颈,认为主要限制因素并非模型本身,而是硬件的底层物理限制,特别是内存带宽。文章解释说,GPU的设计是为了大规模并行处理,对大型数据集执行相同的操作,这对于AI工作负载至关重要。文章强调,LLM的推理速度取决于两个关键GPU资源中较慢的那个:计算能力和内存带宽,并引入了算力强度(arithmetic intensity)的概念来衡量这种关系。
-
vLLM:开源引擎提升 AI 推理吞吐量
vLLM 是一个专为高吞吐量设计的开源推理和服务引擎。它利用 PagedAttention 优化 GPU 利用率,使其成为 AI 开发的 eficient 工具。
-
HARD-KV 框架将 LLM 推理速度提升 2 倍
研究人员开发了 HARD-KV,一个旨在优化长上下文大型语言模型 (LLM) 推理的新框架。该系统解决了头自适应压缩算法(通过动态内存预算提供准确性)与需要静态内存模式以提高效率的现代推理引擎(如 vLLM)之间的冲突。HARD-KV 引入了级联缓存 (Cascade Cache) 层级结构和逻辑校准 (Logits Calibration) 机制,以统一重要性指标并为不同模型头实现一致的预算分配。实验表明,HARD-KV 在保持超过…
-
KV 缓存内存问题困扰 LLM 服务,vLLM 的 PagedAttention 提供解决方案
KV 缓存是 LLM 推理中的关键组件,它存储过去的计算结果,以避免为每个新 token 重新计算。然而,其内存占用可能成为一个重大瓶颈,尤其是在具有并发用户和长上下文窗口的生产环境中。单个序列可能消耗数 GB 的内存,当有多个对话同时进行时,会迅速超出 GPU 容量。传统方法为 KV 缓存预先分配大块连续内存,导致内部碎片化和内存浪费,因为大多数对话并未达到分配的最大长度。
-
Ollama、LM Studio、vLLM:选择合适的本地 LLM 运行时
本文比较了三种本地 LLM 运行时:Ollama、LM Studio 和 vLLM,重点关注它们在生产环境中的适用性。Ollama 因其易于设置和兼容 OpenAI 的 API 而受到关注,非常适合快速的本地开发工作流程,但其批处理支持有限。LM Studio 因其以 GUI 为中心的设计和缺乏并发负载处理能力而被排除在生产环境之外。vLLM 被认为是强大的生产解决方案,提供 PagedAttention 和连续批处理等高级功能以实现…
-
KV 缓存优化解决 LLM GPU 内存瓶颈
大型语言模型 (LLM) 在服务效率方面面临着显著的瓶颈,原因是 KV 缓存的内存需求,它存储中间注意力计算。这个 KV 缓存对于实现更快的响应和处理更长的上下文窗口至关重要,但它会消耗高达 80% 的 GPU 内存。像 vLLM 的 PagedAttention 这样的创新,其灵感来自操作系统内存管理,通过优化 KV 缓存存储和减少内存碎片来解决这个问题,从而显著提高推理吞吐量。