两篇新研究论文提出了通过优化提示缓存和 KV 缓存压缩来降低大型语言模型 (LLM) 运行成本的方法。第一篇论文《Cache-Aware Prompt Compression》提出了一种策略,将查询无关压缩与显式缓存控制相结合,以防止过度压缩,从而在各种生产工作负载上实现显著的成本降低。第二篇论文《VarRate》提出了一种无需训练的 KV 编解码器,该编解码器根据查询显著性为 token 分配可变的低秩预算,在保持准确性的同时仅有极小的性能下降,并在长上下文 LLM 上优于现有方法。 AI
影响 这些技术可以显著降低 LLM 部署的运营成本,使先进的 AI 更易于访问和负担得起。
排序理由 两篇在 arXiv 上发表的学术论文,提出了用于降低 LLM 推理成本的新颖方法。
- Ada-KV
- Anthropic
- Claude Sonnet 4.6
- FastAPI
- httpx
- KV cache
- KVzip
- Llama-3.1:8b
- LongBench: a bilingual, multitask benchmark for long context understanding
- LongBench-v2
- qwen2.5:7b
- SnapKV
- tau-Bench
- VarRate
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →