RadixAttention
PulseAugur coverage of RadixAttention — every cluster mentioning RadixAttention across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
LLM 服务拆分为两个阶段,GPU 通量加倍
现代 LLM 服务架构正通过将过程拆分为两个不同的阶段来更有效地处理请求:预填充(prefill)和解码(decode)。预填充阶段处理整个提示,是计算密集型的,受益于高 GPU 利用率。解码阶段负责逐个生成 token,是内存带宽密集型的,需要高效的 KV 缓存管理。PagedAttention、连续批处理(continuous batching)和分块预填充(chunked prefill)等创新对于优化这些阶段至关重要,而分离式…
-
SGLang推理引擎通过令牌级KV缓存提升LLM性能
SGLang是一款新推出的开源AI推理引擎,旨在显著提升特定LLM工作负载的性能。它采用了一种新颖的RadixAttention机制,以令牌级别缓存KV缓存,从而提高了具有重复前缀(如代理循环和RAG)的应用程序的吞吐量。此外,SGLang将JSON模式编译成有限状态机,以实现更快的结构化输出生成。虽然vLLM在通用用例中仍具竞争力,但SGLang在前缀重用率高的场景中展示了高达5倍的显著加速。
-
明玕 FX100 通过 KV Cache 复用提升 LLM 推理性能 · 追踪 2 个来源
明玕 FX100 在大型语言模型的多轮对话场景中展现了显著的性能提升。通过实施 KV Cache 复用策略(即将先前对话轮次的键值张量缓存起来,避免重新计算),该系统实现了 29-40% 的吞吐量提升和 26-32% 的首个 token 时间缩减。这些提升在冷启动或冷恢复情况下尤为显著,与重新计算整个历史记录的基线相比,系统可以将推理速度提高高达 20 倍。
-
UnfoldML 集成 RadixAttention 以提高 LLM 效率
UnfoldML 推出了 RadixAttention,这是一种提高大型语言模型效率的新方法。该技术旨在降低与注意力机制相关的计算成本,而注意力机制是 LLM 的核心组成部分。RadixAttention 已集成到 Trellis 框架中,旨在使 LLM 的开发和部署更易于访问且性能更高。
-
UnfoldML 使用 RadixAttention KV 缓存优化 LLM 推理
UnfoldML 推出了 RadixAttention,这是一种新的 KV 缓存策略,旨在优化 LLM 推理的预填充阶段。该方法利用基数树数据结构来高效地存储和共享多个并发推理请求之间的共同前缀,从而减少内存使用和计算量。该系统专为用户在本地硬件上部署 LLM 推理而设计,优先考虑数据隐私并适应不同的硬件能力。
-
新技术提升小型LLM的Bash生成能力并加速AI推理
研究人员开发了一种称为语法约束解码的技术,以提高小型语言模型生成Bash命令的能力。该方法增强了准确性和安全性,将自然语言转换为AI代理的shell性能。此外,一种名为自适应并行推理的新方法允许LLM动态地并行化推理任务,从而提高推理速度和准确性,部分实现显示效率提高了40%。