研究人员开发了几种新方法来提高大型语言模型中推测解码的效率。DSpine在模型的骨干网络中引入因果条件注入,以增强令牌之间的信息流,在Qwen3模型上实现了显著的加速和更长的接受长度。LongSpark提出了一种固定成本的并行草稿生成器,使解码成本独立于前缀长度,从而在长上下文任务上提高效率。DScale通过使用自适应验证、路径感知瓦片和动态长度分配来扩展块扩散推测解码,从而在吞吐量方面比现有方法有显著提升。SEED将Transformer重新解释为隐式编码器-解码器,通过重用计算出的表示来廉价地实现高质量的草稿生成,从而提高速度和生成质量。 AI
影响 这些在推测解码方面的进展可以显著降低大型语言模型的推理成本和延迟,从而实现更广泛的应用和更高效的实时应用。
排序理由 arXiv上发表了多篇研究论文,详细介绍了大型语言模型中推测解码的新颖方法。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →