研究人员开发了CAST(成本感知型推测树),一种加速大型语言模型推理的新颖方法。CAST通过将草稿令牌组织成树状结构来优化推测解码,允许目标模型在单遍中验证多个候选。这种方法根据特定部署的验证成本动态调整树的宽度,从而在各种领域和硬件配置中实现高达43%的显著加速。该方法确保目标输出分布保持不变,从而保持了解码质量。 AI
影响 提高LLM推理速度,可能降低AI应用的运营成本和延迟。
排序理由 详细介绍LLM推理加速新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →