llama.cpp 的最新版本 b10174 现在支持 GLM-5.2 模型的投机解码,通过使用一个较小的草稿模型进行超前预测,显著加快了 token 生成速度。同时,vLLM 发布了 v0.26.0 版本,增加了对 Inkling 模型系列的支持,并通过分段 CUDA Graphs 支持提高了推理性能。这些更新旨在提高在本地硬件上运行大型语言模型的效率和可访问性。 AI
影响 提高了在本地硬件上运行 LLM 的效率和可访问性。
排序理由 开源推理引擎和支持基础设施的更新。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →