由 AMD 维护的 llamma.cpp 项目的专用分支,为 AMD 用户提供了显著的性能提升。该分支集成了 ROCm/Hip,据报道,对于密集模型,其提示处理速度可提高一倍,对于 14B 模型可达到 550 tokens/s,而标准 llamma.cpp 的速度为 230 tokens/s。虽然 token 生成速度略有下降,但整体增强表明在本地 LLM 推理方面对 AMD 硬件进行了显著优化。 AI
影响 优化了 AMD 硬件用户的本地 LLM 推理性能。
排序理由 这是针对特定硬件的软件优化,并非新模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →