llamacpp 项目的一项新拉取请求旨在显著提高提示处理速度,特别是对于使用 ROCm 的 AMD GPU。此更新还解决了已发现的一个错误,该错误使 Q2_K 量化方法的速度提高了 28 倍。这些优化有望使拥有 AMD 硬件的用户能够使用更极端的量化配置。 AI
影响 提高 AMD 硬件上本地 LLM 推理的性能,可能使更多用户能够运行更大的模型。
排序理由 这是针对特定软件库 (llamacpp) 的一项改进性能的拉取请求,而不是核心模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →