llama.cpp 项目发布了更新版本 b11453,移除了 GLM5-Next 稀疏注意力的 gather 路径。此更改通过依赖纯粹的 matmul 和 softmax 来简化注意力机制,现在 flash attention 后端更有效地处理掩码行。此次更新还调整了填充的映射方式以及 slot mask 的使用方式。 AI
影响 此次更新优化了 llama.cpp 中的注意力机制,可能导致 GLM5-Next 等模型的推理速度更快。
排序理由 这是与 LLM 推理相关的开源项目的代码更新,特别是优化注意力机制。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →