gfx906-llama-cpp 项目发布了一个更新,显著提高了 AMD GCN GPU(包括 MI50、MI60 和 Radeon VII)的性能。此次更新整合了现有 llama.cpp pull requests 的优化,在预填充性能方面提升高达 23%,在深度填充任务方面提升 14%。该项目还扩展了上下文能力,现在支持高达 250k token 的内存(40GB),同时保持位相同输出。 AI
影响 为特定的 AMD 硬件优化现有的 LLM 推理软件,可能提高本地 LLM 部署效率。
排序理由 这是对一个开源项目的更新,该项目针对特定硬件优化现有软件,而不是来自前沿实验室的新发布或重大行业活动。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →