研究人员推出ResiSpec,一个旨在提高大型语言模型(LLM)推测解码效率的新框架。推测解码通常使用一个较小的模型来预测未来token,然后由主LLM进行验证。然而,可能会出现一种称为“残差漂移”的现象,即被拒绝的候选会导致模型预测发生分歧,从而导致昂贵的重采样。ResiSpec通过在验证过程中重塑提议分布来解决这个问题,有效地锚定残差目标质量,防止候选过时。与现有的多候选推测解码技术相比,该方法已证明可提高高达1.92倍的速度。 AI
影响 通过提高推测解码性能来增强LLM服务效率。
排序理由 详细介绍LLM推测解码新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →