研究人员开发了TopoCompress,一个旨在降低大型语言模型处理长上下文的成本和延迟的新框架。这种无需训练且与模型无关的方法通过识别和选择语义连贯的片段来实现上下文压缩。TopoCompress构建一个混合图,根据语义相似性和顺序邻近性连接这些片段,然后传播相关性分数。在五个不同的长上下文任务中,TopoCompress与现有的压缩基线相比表现更优,在显著更小的压缩预算和更快的处理时间内取得了可比的结果。 AI
影响 降低处理长上下文的LLM的推理成本和延迟,可能促进此类模型的更广泛采用。
排序理由 关于LLM上下文压缩新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →