llama.cpp 的最新版本 b10448 现在完全支持 Kimi-K3 文本模型。此次集成允许用户在本地硬件上运行 Kimi-K3 的高级混合注意力机制,该机制将 KDA 和 MLA 组件与跨层残差注意力相结合。这一扩展使专注于本地 LLM 推理和在 NVIDIA、AMD 和 Intel Arc 等消费级 GPU 上对不同模型架构进行基准测试的个人和组织受益。 AI
影响 在消费级硬件上实现具有高级注意力机制的新模型架构的本地推理。
排序理由 这是推理引擎的软件更新,而不是新的前沿模型发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →