研究人员开发了 Windowed-MTP,一种优化语言模型大上下文窗口投机解码的新技术。该方法通过应用滑动窗口和注意力汇聚点,解决了在百万token上下文下草稿头注意力机制成为瓶颈的问题。Windowed-MTP 无需训练且无损,确保目标模型的输出分布不变。在 Qwen GDN-MoE 和 Mamba2-hybrid 模型上的测试表明,每解码步成本和端到端延迟均显著降低。 AI
影响 这项技术可以显著降低大上下文窗口模型的推理成本和延迟,从而实现更高效的部署和使用。
排序理由 该集群描述了在 arXiv 论文中提出的一种提高语言模型推理效率的新技术。
在 Hugging Face Daily Papers 阅读 →
- Alagappan Valliappan
- KV cache
- Mamba2-hybrid NoPE 120B
- Qwen GDN-MoE 122B
- Qwen GDN-MoE 35B
- SGLang
- Windowed-MTP
- Multi-Token-Prediction
- StreamingLLM
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →