NInfer 项目的一个分叉已被开发出来,为大型语言模型的上下文长度和内存管理带来了显著的改进。该分叉采用自定义的 4 位 KV 缓存,可在不损失质量的情况下将 VRAM 使用量减少 45%,并通过 LongBench 和 AIME 等基准测试得到验证。它还将 Qwen 等模型的上下文窗口扩展到 555k token 以上,并预计在高 端 GPU 上可达 800 万 token。该项目增强了多级前缀重用,并实现了一个强大的主机 KV 缓存安全网,以确保并发会话的稳定性能。 AI
影响 提高了本地 LLM 部署的效率和上下文处理能力,有可能在消费级硬件上实现更复杂的任务。
排序理由 这是现有工具的一个分叉,具有新功能,而不是前沿模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →