一个名为 `cache-pressure` 的新开源工具已被开发出来,用于在压力下精确测量本地 LLM 的 KV 缓存性能。该工具通过填充上下文来验证广告的缓存大小,然后测试逐出策略。使用该工具对 vLLM 进行的初步结果显示,在开发者的修复后,广告的 200 万 token 缓存大小实际上支持了 300 万个保留的 token,性能显著优于之前仅保留广告容量约一半的配置。 AI
影响 为用户提供了一种方法来验证和优化其本地 LLM 部署的实际 token 容量。
排序理由 该集群描述了一个用于验证 LLM 缓存性能的新开源工具。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →