实体
Prefix Caching
Prefix Caching
PulseAugur coverage of Prefix Caching — every cluster mentioning Prefix Caching across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
LLM 服务拆分为两个阶段,GPU 通量加倍
现代 LLM 服务架构正通过将过程拆分为两个不同的阶段来更有效地处理请求:预填充(prefill)和解码(decode)。预填充阶段处理整个提示,是计算密集型的,受益于高 GPU 利用率。解码阶段负责逐个生成 token,是内存带宽密集型的,需要高效的 KV 缓存管理。PagedAttention、连续批处理(continuous batching)和分块预填充(chunked prefill)等创新对于优化这些阶段至关重要,而分离式…
-
大语言模型推理引擎通过前缀缓存优化提示处理
大型语言模型(LLMs)经常反复重新计算相同的初始提示标记,导致效率低下。本文解释了KV缓存,它在标记生成过程中存储中间状态,是优化的关键。通过实现前缀缓存,系统可以为相同的提示前缀重用这些存储的状态,显著减少计算时间和提高响应速度,特别是对于长而共享的提示。
-
vLLM 配置影响 LLM 的能耗、性能和准确性
一篇新的研究论文探讨了在为大型语言模型 (LLM) 配置 vLLM 等推理引擎时,能耗、性能和准确性之间的权衡。该研究分析了五种开源 LLM 和五种推理任务中,注意力核类型、前缀缓存和分块预填充的组合。结果表明,注意力类型和前缀缓存对能耗和性能有显著影响,其影响因模型和工作负载而异,而在默认配置下,分块预填充的影响有限。研究还发现,推理引擎的选择可能会意外地影响模型的准确性。