llama.cpp 项目发布了更新 b11430,专注于 hexagon 架构的性能改进。此次更新为 flash-attention 引入了头并行分区,允许每个核心处理 KV 缓存的特定头分片。这一改变显著提升了 Qwen3-0.6B 和 Llama 3.2:3b 等特定模型的性能,分别测量到高达 58% 和 49% 的提升。更新还包括了受 GGML_HEXAGON_FA_HEAD_SPLIT 标志控制的矩阵乘法和多设备场景的各种优化。 AI
影响 提高了特定硬件架构上 AI 模型的推理速度。
排序理由 开源项目的软件更新,专注于性能优化。
- flash_attn
- Gemma-4 MoE
- GGML_HEXAGON_FA_HEAD_SPLIT
- hexagon
- Llama 3.2:3b
- llama.cpp
- Qwen3 0.6B
- Qwen3.5 4B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →