一篇新研究论文介绍了一种用于大型语言模型推测解码的新型框架TreeGraft,该框架采用了多个不同大小的草拟器。通过使用一个更强的草拟器来重新评分和优化一个较弱草拟器生成的候选词,这种方法旨在克服单草拟器系统中速度和质量之间的权衡。TreeGraft在各种模型对和基准测试中平均性能提升了15.1%,优于固定的单草拟器策略。 AI
影响 这种多草拟器推测解码方法可以显著提高LLM的推理效率并降低延迟。
排序理由 该集群包含一篇详细介绍LLM推测解码新方法的论文。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
- Scite
- eagle
- GPT-2
- large language model
- Medusa
- speculative decoding
- large language models
- Self-Speculative
- Speculative Sampling
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →