研究人员开发了一种名为轨迹检索推测解码(TLAR)的新方法,以提高大型语言模型的效率。TLAR利用模型自身生成的历史来寻找可重用的续写,有效地充当运行时内存。这种方法根据最近的验证结果调整检索,并将检索到的续写与模型生成的草稿相结合,以维持目标模型的输出分布。在代码调试、数学和写作任务上的评估表明,TLAR提高了令牌接受率并增加了端到端吞吐量。 AI
影响 这种方法可能导致更快、更高效的LLM推理,从而降低AI应用的计算成本。
排序理由 该集群包含一篇详细介绍改进LLM推理新方法的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- TLAR
- Trajectory-Local Adaptive Retrieval
- Trajectory-Retrieval Speculative Decoding
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →