研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力机制如何影响学习型 KV 缓存驱逐策略的有效性。 AI
影响 这些 KV 缓存压缩技术对于实现更大的上下文窗口和更有效地部署 LLM 至关重要,尤其是在 GUI 代理交互等复杂任务中。
排序理由 多篇研究论文介绍了 LLM 中 KV 缓存压缩的新颖方法。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- FP8
- GUI agents
- Hugging Face
- KV cache
- LLM
- LongBench-v2
- Minima-KV
- Nvidia RTX Pro 6000 Blackwell Workstation Edition
- PuzzleKV
- Qwen3.6-27B
- RULER
- Sigmoid Attention
- ST-Lite
- TQ3
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →