vLLM 项目发布了 0.25.0 版本,将 Model Runner V2 作为密集模型的默认选项,增强了量化支持,从而实现更高效的本地 LLM 推理。此次更新旨在提高吞吐量和降低延迟,使在消费级硬件上运行复杂的开源模型更加容易。此外,Ollama v0.32.5 已发布,修复了影响 Apple Silicon 上 NVFP4 模型输出质量的错误,确保了 macOS 设备上本地推理的可靠性。 AI
影响 提高了在消费级硬件上本地运行大型语言模型的效率和可访问性。
排序理由 此集群报告的是 LLM 推理工具的软件发布,而非前沿模型发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →