llama.cpp 项目已发布 b11528 版本,其中包括对处理张量主机视图的修复。此更改由 Qwen3.8 Flash-Next 协助,解决了使用部分卸载进行张量拆分时 KV 缓存视图出现的断言错误。此次更新还重新启用了 K2 Horizon 的 SM 张量支持,并添加了一个 TODO 引用。 AI
影响 提高 llama.cpp 推理引擎用户的性能和稳定性,特别是那些使用部分卸载和 KV 缓存的用户。
排序理由 这是一个特定工具的软件发布,而不是前沿模型发布或重要的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →