研究人员开发了REVA,一个旨在提高检索增强生成(RAG)系统效率的新框架。REVA通过将历史查询-文档交互聚合为可重用的证据视图,解决了RAG中更长上下文带来的延迟增加和内存使用增加的挑战。该方法挖掘生成器的注意力轨迹,创建与预算无关的分数存储,然后渲染文档的压缩、保持顺序的视图。基准测试表明,REVA在显著降低压缩开销并增加最小延迟的同时,大幅提高了生成质量。 AI
影响 提高RAG效率,可能降低LLM应用的成本和延迟。
排序理由 该集群包含一篇详细介绍检索增强生成新框架的研究论文。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- large language model
- retrieval-augmented generation
- Reva
- ScienceCast
- KV cache
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →