arXiv 上发表的一项新研究评估了大型语言模型 (LLM) 缓存的各种驱逐策略,发现最不常用 (LFU) 策略在测试中表现最佳。该研究使用了一个名为 CLEVER 的框架,在不同的工作负载、缓存容量和编码器中比较了 FIFO、LRU 等策略。研究结果表明,虽然 LFU 是一个强有力的默认选项,但由于在典型操作点下答案可替代查询的百分比很低,驱逐策略的有效性受到限制,这表明在优化驱逐策略之前应优先考虑建立答案的有效性。 AI
影响 强调了当前 LLM 缓存策略的局限性,建议在优化驱逐策略之前需要改进答案有效性检查。
排序理由 评估 LLM 缓存机制的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]
- CLEVER
- FIFO
- Hugging Face
- Large Model Systems Organization
- LLM
- LRU
- MiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression of Pre-Trained Transformers
- SISO
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →