研究人员开发了 Spectral-LSH,一种新颖的无需训练的方法,用于压缩语言模型的长提示,解决了预填充注意力中的二次方扩展问题。该技术使用 Krylov 子空间方法和随机特征来近似注意力核算子,然后采用 SimHash 将相似的 token 分组为宏 token。在 Mistral-7B-Instruct-v0.3 和 Qwen2.5 模型上的评估表明,Spectral-LSH 在更高级别的压缩比(8 倍和 16 倍)下能有效保持质量,而简单的分块方法在此类情况下会失效,并且自适应后端结合了这两种方法。 AI
影响 该方法可以显著降低长上下文语言模型的推理成本,从而更有效地处理长输入。
排序理由 该集群包含一篇详细介绍语言模型提示压缩新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →