研究人员开发了一种名为MIST(Model-Internal Saliency for Token-level CoT compression)的新方法,以降低大型语言模型(LLM)思维链(CoT)推理的计算成本。MIST通过分析其对模型内部“思想流”的影响,来识别和修剪不太重要的推理Token。它根据“必要性”(移除Token的贡献后答案质量下降的程度)和“充分性”(仅提供该Token的贡献后答案质量提高的程度)来衡量Token的重要性。在多个基准测试和模型上的实验表明,MIST在压缩CoT痕迹方面优于现有方法。 AI
影响 该方法可以显著降低LLM复杂推理任务的推理成本,使其更高效、更易于访问。
排序理由 该集群包含一篇详细介绍LLM推理压缩新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →