vLLM 项目发布了 0.29.0 版本,该版本现在默认使用 Model Runner V2 (MRV2) 来支持所有模型。此更改简化了内部执行流程,以增强内存处理和运行时效率,使运行本地推理或高吞吐量生产服务集群的用户受益。建议依赖旧版运行器钩子的自定义集成或高度定制化分支的开发者在升级前测试兼容性。 AI
影响 提高了运行本地 LLM 推理或生产服务的用户的效率并简化了部署。
排序理由 推理引擎的软件发布,而非前沿模型发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →