vLLM
PulseAugur coverage of vLLM — every cluster mentioning vLLM across labs, papers, and developer communities, ranked by signal.
- developed PagedAttention 95%
- used by PagedAttention 90%
- developed by PagedAttention 90%
- used by FLASH 90%
- developed DiffusionGemma 90%
- developed by DiffusionGemma 90%
- uses PagedAttention 90%
- used by Gemma 4.31B 90%
- instance of DiffusionGemma 90%
- used by Qwen3.8-2.4T-A95B 90%
- used by Nexus Labs 90%
- used by MI355x 90%
- 2026-10-06 product_launch vLLM released version 0.31.1rc0, a release candidate that includes new metrics for cached prompt tokens. 来源
- 2026-10-05 product_launch vLLM released version 0.31.0 with significant serving upgrades. 来源
- 2026-10-05 product_launch vLLM released version 0.31.0 with enhanced security features. 来源
- 2026-10-02 product_launch vLLM released version 0.31.0 and its release candidate v0.31.0rc5, updating dependency requirements. 来源
- 2026-10-01 research_milestone A developer's test demonstrated that a specific vLLM flag can significantly reduce token costs. 来源
- 2026-09-29 product_launch vLLM released version 0.31.0rc1, a release candidate addressing a build issue. 来源
- 2026-09-16 product_launch The vLLM project released version proto-v0.3.0 of its library. 来源
- 2026-09-11 product_launch vLLM has released version 0.29.0. 来源
- 2026-09-09 product_launch vLLM released version 0.29.0, defaulting to Model Runner V2 for all models. 来源
- 2026-09-07 product_launch vLLM has implemented speculative decoding for AMD GPUs, enhancing inference performance. 来源
- 2026-09-03 research_milestone The vLLM team implemented significant optimizations for agentic workloads, including a new benchmark and improvements to inference throughput and serving efficiency. 来源
- 2026-08-21 product_launch vLLM released version 0.28.0rc2, featuring the DFlash2 system. 来源
- 2026-08-12 product_launch vLLM released version 0.27.2rc0 with new features and contributions. 来源
- 2026-08-11 product_launch vLLM has been released for Windows and supports AMD hardware. 来源
- 2026-08-10 product_launch vLLM released version 0.27.0, featuring an update for Tensor Processing Units. 来源
24 天有情绪数据
vLLM 如何在本季度推进 LLM 推理性能?vLLM 通过 PagedAttention 和 Continuous Batching 等创新技术持续革新 LLM 推理。这些由 vLLM 开创的核心技术显著优化了 KV 缓存管理,减少了内存浪费并实现了更高的并发性。进一步的增强功能包括使用 DLFP 进行动态预填充分块大小调整以及通过 APEX 进行自适应推测解码,所有这些都旨在提高吞吐量并降低延迟。 vLLM 的部署和集成正在扩展到何处?vLLM 正在从本地机器到主要的云提供商的各种部署场景中巩固其作用。讨论强调了其在 AWS SageMaker 上用于对开源 LLM 进行细粒度控制的用法,这与 Amazon Bedrock 的托管体验形成对比。该平台还通过 Ollama 和 LangChain 等工具简化了本地 SLM 部署,使开发人员能够构建具有成本效益的私有 AI 代理。 vLLM 的最新稳定性和安全更新是什么?vLLM 正在通过最近的更新和错误修复积极解决关键的稳定性和安全问题。最近的报告详细介绍了 RTX 5090 上的 VRAM 压力问题以及 MoFlux 的容量恢复延迟,这表明需要持续优化。至关重要的是,v0.30.0 中的权重缓存漏洞和 LoRA 适配器缩放错误已被识别并正在解决,从而确保更可靠和安全模型服务。 vLLM 如何增强硬件兼容性和生态系统支持?vLLM 正通过关键合作伙伴关系显著拓宽其硬件兼容性并加强其生态系统。AMD 在 vLLM 测试中实现了超过 90% 的兼容性,这标志着更广泛的 GPU 支持取得了重大里程碑。T-CCL 等新库正在提高多 GPU 性能,并且针对华为 Ascend 硬件的优化展示了 vLLM 对多样化基础设施的承诺,确保了更广泛的可访问性和效率。 vLLM 如何保持其在 LLM 服务领域的领先地位?尽管出现了专门的竞争对手,vLLM 仍继续在 AI 推理服务器领域保持领先地位。vLLM 作为顶级推理服务器,其通用效率正面临 EAServe(用于多模态任务)或 NInfer(用于代理工作负载)等解决方案的挑战。然而,其在核心技术方面的持续创新以及对各种部署模型的强大支持,凸显了其持久的相关性和强大的竞争地位。
近期动态
- — vLLM 在本地 LLM 推理期间在 RTX 5090 上遇到 VRAM 压力减慢。
- — vLLM 被评为顶级 AI 推理服务器,得分为 74/100。
- — PagedAttention 和 Continuous Batching 被强调为 vLLM 中 LLM 推理的革命性技术。
- — 经过数月的努力,AMD 在 vLLM 测试中实现了超过 90% 的兼容性。
- — 在 vLLM v0.30.0 中发现关键的权重缓存漏洞,导致模型服务不正确。
- — vLLM v0.31.0 使用 FlashMLA、DeepGEMM 和 MXFP8 增强了服务。
为何这些故事上榜
-
88
This cluster directly affirms vLLM's market leadership, highlighting its strong performance and positioning as the top choice for AI inference, which is a significant signal of its impact.
-
85
This story underscores vLLM's foundational innovations, PagedAttention and Continuous Batching, which are critical for efficient LLM serving and widely recognized as industry standards.
-
82
This cluster provides crucial insights into vLLM's strategic deployment options within major cloud ecosystems, offering a practical comparison for users and validating its enterprise relevance.
-
79
This development signals a significant expansion of vLLM's hardware compatibility, addressing a key user demand and broadening its potential user base and deployment scenarios.
-
77
This cluster highlights a critical security vulnerability, demonstrating vLLM's commitment to transparency and the ongoing need for robust security in high-stakes AI inference.
-
75
This story showcases vLLM's continuous drive for performance improvement, integrating advanced libraries to optimize multi-GPU setups and enhance overall inference throughput.
vLLM报道走势
趋势
Coverage of vLLM is accelerating, driven by its continued leadership as a top inference server (282046) and foundational innovations like PagedAttention (279517). Significant developments in cloud deployment (282544) and expanded hardware support for AMD (278021) further fuel this momentum, despite ongoing efforts to address stability and security issues.
与同行对比
vLLM maintains its strong position for general LLM serving, often benchmarked as a leader. While specialized engines like EAServe (268989) or NInfer (274998) target niche multimodal or agentic tasks, vLLM's broad applicability and continuous performance enhancements, including multi-GPU optimization (284363), keep it competitive against both specialized tools and managed cloud services like Bedrock.
话题分布
This cycle, vLLM's coverage continues to heavily feature "infra" (performance, memory, multi-GPU, hardware compatibility) and "product" (deployment, cloud/local). There's an increased focus on "bug fixes" and "security" due to recent vulnerabilities, alongside a growing emphasis on "quantization" challenges and solutions.
编辑观点
Our read on vLLM this cycle confirms its position as a leading LLM inference server, driven by continuous innovation in core technologies like PagedAttention. We see a strong push towards broader hardware compatibility and flexible deployment options, from local setups to major cloud providers. While addressing critical stability and security vulnerabilities, vLLM's ongoing advancements solidify its role as a robust and adaptable solution for diverse AI inference needs.
常见问题
- vLLM 如何优化 LLM 推理性能?
- vLLM 采用 PagedAttention 和 Continuous Batching 等关键创新来高效管理 KV 缓存,显著减少内存浪费并提高并发性。这些技术通过保持 GPU 持续运行来提高吞吐量并降低延迟。最近的更新还集成了 FlashMLA 和 DeepGEMM 等高级方法,进一步完善了其服务功能,并确保在各种模型和硬件配置上实现最佳性能。
- 在 AWS 等云平台上部署 vLLM 有哪些选项?
- 在 AWS 上,vLLM 可以通过 Amazon SageMaker 进行部署,为用户提供对服务层、计算资源和推理配置的广泛控制。这种方法非常适合需要精确性能调优的应用程序。虽然 Amazon Bedrock 提供了更托管的体验,但 SageMaker 结合 vLLM 允许对 GPU 利用率、内存和批处理进行细粒度管理,尽管这需要更多的手动故障排除和基础设施管理。
- vLLM 最近解决了哪些稳定性和安全问题?
- vLLM 最近处理了几个关键问题。v0.30.0 中的权重缓存漏洞可能导致服务权重不正确的模型,而另一个错误导致 LoRA 适配器缩放不正确,从而降低了性能。此外,关于 RTX 5090 上的 VRAM 压力导致速度减慢以及 MoFlux 容量恢复延迟的报告,凸显了持续的挑战。v0.31.0 和 v0.31.1rc0 等最新版本引入了安全增强功能和新指标,以提高稳定性和透明度。
- vLLM 如何扩展对不同硬件和生态系统的支持?
- vLLM 正在积极扩展其硬件和生态系统支持。AMD 在 vLLM 的测试套件中实现了超过 90% 的兼容性,表明与 AMD GPU 的兼容性良好。T-CCL 等新库的集成正在提高多 GPU 性能,特别是对于 Transformer 模型。此外,为华为 Ascend 卡等定制硬件设置优化 vLLM 的工作,展示了其适应性以及在更广泛的计算环境中提供高效 LLM 推理的承诺。
相关
-
新攻击目标大语言模型服务框架,绕过模型防御
研究人员开发了一种新的方法来攻击大语言模型(LLM)的服务框架,而不是模型本身。这种“填充与挤压”(Fill and Squeeze)策略通过耗尽 KV 缓存并强制重复抢占来攻击调度器的状态转换。该攻击在 vLLM 框架上显著降低了首次令牌生成时间(TTFT)和每个输出令牌的时间,在实际的黑盒环境中以比以前更低的成本证明了其有效性。
-
Gemma 4 E2B 在 AMD MI300X 上不同权重格式的性能测试
本文详细介绍了在 AMD Instinct MI300X GPU 上运行 Gemma 4 E2B 语言模型时,不同权重格式的性能比较。作者提供了使用 vLLM 部署十种不同权重格式的详细指南,并对不同请求数量和提示长度下的每种配置进行了计时。结果表明,FP8 是最快的格式,性能与 bfloat16 非常接近,而 INT8 和 4 位格式的输出速度较慢但可能更精确。文章提出了速度与保真度之间的权衡选择,并指出 MI300X 充足的内存容…
-
Anyscale 详解通过自托管 LLM 将编码代理成本降低 90%
Anyscale 发布了一份指南,详细介绍了如何将运行编码代理的相关成本大幅降低高达 90%。该方法涉及使用其平台自托管大型语言模型 (LLM),该平台集成了 Ray Serve 和 vLLM,而不是依赖按 token 收费的 API 定价。这种方法不仅能节省大量成本,还能提供增强的数据隐私和性能改进,例如更快的编译时间和更高的请求吞吐量。
-
SPIN方法提升LLM注意力效率,降低延迟并提高吞吐量
研究人员开发了一种新颖的方法SPIN(Shadow Predictive Indexer),用于优化大型语言模型中的稀疏注意力机制。SPIN通过使用轻量级的、基于历史的预测来识别重要的KV块,从而减少了对整个KV缓存进行评分的计算开销。这种方法在保持任务质量的同时实现了显著的稀疏性,并在vLLM中将服务吞吐量提高了14.9%,将延迟降低了13.2%。
-
ConwayResearch 发布具有广泛兼容性的 Underdog-Saluki-27B-1.0 模型
ConwayResearch 发布了 Underdog-Saluki-27B-1.0 模型,这是一个拥有 270 亿参数的语言模型。此次发布提供了详细的使用说明和兼容性信息,以便将该模型与各种推理引擎和应用程序配合使用。这些工具包括 llama.cpp、vLLM、Ollama、LM Studio 和 Jan 等流行工具,以及笔记本电脑和本地应用程序的集成指南。该模型也可通过 Docker 访问,并在 Raspberry Pi 等设备上运行。
-
本地 LLM 运行时显示不一致的工具调用解析器支持
对四个流行的本地 LLM 运行时——Ollama、llama.cpp、vLLM 和 SGLang——的最新分析显示,它们在支持各种模型系列的工具调用方面存在不一致。虽然这些运行时总共提供了 136 个命名的工具调用解析器,但在所有四个运行时中,只有 8 个支持的模型系列拥有专用的解析器。这些解析器的文档通常滞后于代码更新,许多解析器出现在代码中但未出现在官方文档中。
-
vLLM 的 LMCache 服务器中发现关键远程代码执行漏洞
在 vLLM 使用的键值缓存服务器 LMCache 中发现了一个关键的远程代码执行漏洞(CVE-2026-105192),CVSS 评分为 9.8。该漏洞存在于 0.3.9 至 0.5.5 版本中,允许未经身份验证的攻击者通过利用多进程模式下暴露的 ZeroMQ 套接字以 root 权限执行任意代码。截至报告发布时,尚无针对此漏洞的修复方案。
-
vLLM 推测解码性能问题详解
本文深入探讨了 vLLM 框架中推测解码的性能影响,尤其是在服务器负载过重的情况下。文章考察了接受率的数学原理、批处理大小优化的潜在陷阱,并提供了调整 vLLM 参数以缓解性能下降的指导。旨在帮助用户优化其 vLLM 部署,以提高效率和吞吐量。
-
SketchSSM 方法将 LLM 状态读取效率提升 10 倍
研究人员推出了一种新颖的方法 SketchSSM,通过近似状态读取来提高混合注意力模型的效率。该技术通过缓冲键值来减少 KV 缓存的增长并实现更大的解码批次,同时仍能保持准确性。SketchSSM 在 NVIDIA B300 和 Nemotron 3 Super 等硬件上实现了显著的加速和更高的解码吞吐量,优于标准的 vLLM 基线。
-
APEX系统通过自适应推测解码优化LLM推理
研究人员开发了APEX,一个旨在提高大型语言模型推理效率的新系统。APEX采用了一个学习型控制器,该控制器根据生成文本的可预测性动态调整推测解码策略。它从多种推测方法中进行选择,包括EAGLE-3等专家模型和n-gram方法,并在每个验证步骤中调整token草稿的深度。这种自适应方法旨在减少计算浪费并提高推理速度,与传统的自回归解码相比实现了显著的加速。
-
新的 T-CCL 库利用 TMA 提升多 GPU AI 模型性能
研究人员开发了 T-CCL,这是一个专为大型 Transformer 模型中高效多 GPU 执行而设计的新型集体通信库。T-CCL 利用张量内存加速器 (TMA) 来卸载数据移动和归约操作,显著减少了 GPU 流式多处理器 (SM) 上所需的计算资源。这种减少使得通信和计算能够更好地并发执行,从而提高性能。评估显示,在资源受限的条件下,T-CCL 的性能比 NCCL 等现有库高出 3.42 倍,并提高了 vLLM 等系统中的端到端推理吞吐量。
-
RTX 5090 显存压力导致本地 LLM 速度下降
一位用户在使用本地大语言模型时遇到了显著的性能下降,token 生成速度从每秒 77 个下降到 7 个。这种速度下降发生在视频通话期间,视频通话似乎占用了 GPU 的显存,将其推向了极限。尽管性能有所下降,vLLM 服务进程并未报告任何错误或内存不足的情况。通过重启 vLLM 进程解决了该问题,这表明问题出在服务进程的内存状态,而不是模型或提示本身。
-
非官方 GLM-5.3-Flash 衍生模型,针对 NVIDIA DGX Spark 进行了优化
一个名为 autotrust/GLM5.3-Flash-E224-DGX-Spark 的 zai-org/GLM-5.3-Flash 模型非官方衍生版本,专为 NVIDIA DGX Spark 等桌面 Blackwell 系统开发。该优化版本保留了原模型相当一部分的专家,同时利用 NVFP4 提高效率,使其能够容纳在两个 DGX Spark 或单个 180 GB Blackwell GPU 的内存限制内。该模型保留了原模型完整的词汇表…
-
Kolibri-1 (78B MoE) 在 NVIDIA H200 上进行 NIS-2 合规性基准测试
一项新的基准测试使用 vLLM 在 NVIDIA H200 硬件上评估了 Kolibri-1 (78B MoE) 模型,重点关注 NIS-2 合规性、事件报告和越狱弹性。测试显示,Kolibri-1 成功抵御了 97.5% 的提示注入,并在检索增强生成 (RAG) 任务中实现了高精度,当以法律文本为锚定时,精度范围为 96.4% 至 100%。然而,在没有法律背景的情况下,该模型在闭卷场景下对截止日期的遵守率显著下降至 40-53%。
-
vLLM 发布 v0.31.1rc0,新增缓存指标
vLLM 发布了 0.31.1rc0 版本,引入了一项新指标,用于根据缓存层级公开缓存的提示 token。此更新是一个发布候选版本,表明它是在稳定版本发布前用于测试和反馈的预发布版本。该版本由 Cam Quilici 标记,并包含 Nick Hill 和 Yifan Qiao 的贡献。
-
MoFlux 准入控制显示 LLM 推理中的容量恢复延迟
MoFlux,一个用于 LLM 推理引擎的准入控制层,已对其容量恢复能力进行了评估。在 Apple M1 设置上使用 vLLM 和 Qwen2.5-1.5B-Instruct 模型进行的测试表明,虽然 MoFlux 允许交互式请求在 1 秒内重新进入,但借用容量的批量请求需要更长时间才能完成,长提示的完成时间长达 20 秒。引擎对返回的交互式请求的调度也引入了延迟,一种设计在拨款恢复后导致 3.6 到 4.0 秒的等待时间。这些容量恢…
-
AWS 大语言模型部署:SageMaker vLLM 对比 Bedrock 开源模型
在 AWS 上部署开源大语言模型(LLMs)涉及的复杂性超出了初始设置,尤其是在基础设施所有权和性能扩展方面。本文对比了两种 AWS 方法:一种是使用 vLLM 的 Amazon SageMaker,以获得对服务层的更大控制权;另一种是使用 Amazon Bedrock,以获得更受管理的体验。使用 vLLM 的 SageMaker 方法提供了对计算、推理引擎和配置的细粒度控制,适用于模型和推理性能至关重要的应用程序。然而,这种控制需要…
-
FP8量化成本节省因模型输出问题而产生误导
一位开发者发现,在AMD MI300X GPU上使用vLLM进行FP8量化,特别是针对Qwen2.5模型,导致GPU成本显著降低了47%。然而,这种成本节省具有误导性,因为模型开始输出重复的垃圾标记,而不是有意义的响应。在使用预量化的FP8模型时,成本节省更为适度(约33%),但模型的输出质量保持不变。开发者建议在应用量化后,检查输出长度和在temperature为0下的几个固定提示,以确保模型完整性,而不是仅仅依赖每token成本指标。
-
vLLM 领跑 AI 推理服务器
vLLM 已被认定为顶级推理服务器,得分 74/100。该评分凸显了其在人工智能推理领域的当前领先性能。
-
自托管 LLM:驱动成本的是 GPU 利用率,而非硬件成本
自托管大型语言模型(LLM)通常成本更高,这是由于 GPU 利用率低下,而非硬件成本本身。每百万 token 的实际成本很大程度上受吞吐量影响,而吞吐量取决于 GPU、模型、请求模式和服务器配置。通过 vLLM 等技术普及的连续批处理,可以通过同时处理多个请求来保持 GPU 忙碌,从而极大地提高吞吐量,与单请求处理相比,成本可能降低 10 倍以上。