PulseAugur
实时 14:35:27
English(EN) Anyone else tried out KV cache blending?

KV缓存混合技术将LLM预填充速度提升3倍

Reddit的r/LocalLLaMA子版块的一位用户分享了一种名为KV缓存混合的技术,该技术显著加快了大型语言模型的提示处理速度。该方法包括将提示分成更小的块,为每个块生成单独的KV缓存,然后将它们连接起来。用户报告预填充速度提高了3倍,在256k token的上下文长度下实现了约每秒1.3k token的速度,同时即使在分割的提示部分之间也能保持完整的检索能力。 AI

影响 这项技术可以显著提高LLM的推理速度,从而加快长上下文的处理速度,并可能降低运营成本。

排序理由 用户开发的用于提高LLM推理性能的技术。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

KV缓存混合技术将LLM预填充速度提升3倍

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/maddie-lovelace ·

    有人试过KV缓存混合吗?

    <!-- SC_OFF --><div class="md"><p>Idea is simple-ish in abstract: instead of running normal prefill over all of a given prompt, split it into parts - generates caches for part A and part B in isolation, concatenate the result, feed it into decode like normal.</p> <p>I honestly th…