明玕 FX100 在大型语言模型的多轮对话场景中展现了显著的性能提升。通过实施 KV Cache 复用策略(即将先前对话轮次的键值张量缓存起来,避免重新计算),该系统实现了 29-40% 的吞吐量提升和 26-32% 的首个 token 时间缩减。这些提升在冷启动或冷恢复情况下尤为显著,与重新计算整个历史记录的基线相比,系统可以将推理速度提高高达 20 倍。 AI
影响 加速长上下文和多轮对话应用的 LLM 推理,降低延迟并提高吞吐量。
排序理由 该集群描述了一种用于优化 LLM 推理的特定软硬件解决方案,侧重于部署和可衡量的性能提升,而非新模型发布或基础研究突破。
- DeepSeek R2
- KV cache
- Mingxin FX100
- Mingxin Technology
- PagedAttention
- Proceedings of the 29th Symposium on Operating Systems Principles
- Qwen3-Coder-480B-FP8
- Rodalies Barcelona line R3
- AMD MI308X
- KV Cache reuse
- R2/R3
- RadixAttention
- SGLang
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →