vLLM 发布了 0.31.0 版本,为其服务能力带来了重大增强。此次更新将 FlashMLA 与 V4.1 NVFP4 压缩 KV 缓存集成,作为 SM100 的默认配置,并包含了 DeepGEMM。该版本还具有稀疏 MQA logits、Mega-Gate 融合以及使用 MXFP8 量化的融合小批量 WO-A。 AI
影响 vLLM 的最新版本为 AI 服务基础设施提供了性能改进。
排序理由 这是一个基础设施工具的软件发布,不是前沿模型发布或重大行业事件。
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →