llama.cpp 项目发布了一个更新 (b11513),显著优化了 top-k 算法的 CUDA 实现。此更新用更高效的 grid-over-rows radix select 替换了 per-row DeviceTopKKernel,适用于行数较多的情况,从而大幅缩短了处理时间。例如,在 qwen4exp 模型上,使用 34,816 个 token 时,top-k 操作速度从超过 5.7 秒提高到大约 941 毫秒。该版本还根据形状优化了最佳 top-k 实现的选择,根据行长度和配置使用 bitonic、radix select 或 DeviceTopK/CUB argsort。 AI
影响 通过 llama.cpp 提高了在支持 CUDA 的硬件上运行模型的推理性能。
排序理由 这是开源项目的一个软件更新,它提高了特定算法在某些硬件上的性能,而不是前沿发布或重大的行业事件。
- ARGSORT
- CUDA
- DeviceTopK
- DeviceTopKKernel
- GGML_CUDA_TOPK_RADIX_MIN_ROWS
- llama.cpp
- praneshgo
- Pranesh Gonegandla
- qwen4exp
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →