SGLang是一款新推出的开源AI推理引擎,旨在显著提升特定LLM工作负载的性能。它采用了一种新颖的RadixAttention机制,以令牌级别缓存KV缓存,从而提高了具有重复前缀(如代理循环和RAG)的应用程序的吞吐量。此外,SGLang将JSON模式编译成有限状态机,以实现更快的结构化输出生成。虽然vLLM在通用用例中仍具竞争力,但SGLang在前缀重用率高的场景中展示了高达5倍的显著加速。 AI
影响 加速具有高前缀重用率工作负载的LLM推理,可能降低运营成本并提高响应速度。
排序理由 该条目描述了一个具有特定性能优势的新推理引擎,将其定位为优化LLM部署的工具。
- A10G
- Chatbot Arena
- convly.ai
- Large Model Systems Organization
- Llama-7B
- Mixtral 8x7B
- RadixAttention
- SGLang
- turion.ai
- Vicuña
- vLLM
- Yotta Labs
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →