研究人员开发了使用推测性解码加速语言模型推理的新方法。一种方法 SpecVocab 专注于优化较小草稿模型用于预测目标模型输出的词汇表,与 EAGLE-3 等现有方法相比,可实现更高的接受长度,吞吐量提高高达 8.1%。另一种方法渐进式树草稿 (PTD) 在目标模型本身内利用结构化的并行草稿策略,采用树结构和剪枝机制来探索多个语义路径。PTD 在各种基准测试中展示了高达 2 倍的解码加速,而无需额外的训练或模型修改。 AI
影响 推测性解码的这些进步可以显著降低大型语言模型的延迟和计算成本,从而实现更快的实时应用程序和更高效的部署。
排序理由 该集群包含两篇详细介绍加速语言模型推理的新方法的论文。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- Miles C. Williams
- ScienceCast
- scite Smart Citations
- SpecVocab
- GitHub
- inference
- language model
- MINE-USTC
- Progressive Tree Drafting
- speculative decoding
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →