BeeLlama 项目的新分支 BeeLlama-Kvarn 已发布,为 KVarn KV 量化提供了显著的速度提升。据报道,与原始 BeeLlama 实现相比,该分支的速度提高了高达 76%,尤其是在高上下文深度下。其优化目标是匹配或超越 llama.cpp 在同等量化下的速度,测试表明即使在超过 160,000 个 token 的上下文深度下,其性能也相当或更好。 AI
影响 为运行具有 KVarn KV 量化的本地 LLM 的用户提供了潜在的性能提升。
排序理由 这是现有工具的一个分支,具有性能改进,而不是新的前沿模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →