研究人员已经形式化了大型语言模型中KV缓存逐出问题,超越了基于启发式的方法。通过概率化地构建KV逐出问题,该问题被简化为期望估计,可以通过采样来近似。这种方法还能够纠正解码过程中被逐出的条目,这是一个先前被忽视的问题。所提出的概率方法与解码时纠正相结合,在各种任务中表现出更强的鲁棒性,并取得了有竞争力的性能。 AI
影响 形式化KV缓存逐出,可能提高LLM推理效率和吞吐量。
排序理由 该集群包含一篇发表在arXiv上的研究论文,详细介绍了一种解决LLM推理技术问题的新理论方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- KV cache
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →