PulseAugur
实时 01:51:41

HeatKV 方法压缩视觉自回归模型 KV 缓存

研究人员开发了 HeatKV,一种用于压缩视觉自回归模型所使用的 KV 缓存内存的新颖方法。该技术根据每个注意力头对先前生成的图像尺度的关注程度来调整其缓存分配。HeatKV 在 Infinity-2B 模型上实现了比现有方法高 2 倍的压缩率,同时保持了图像质量和提示对齐。 AI

影响 引入了一种显著降低视觉自回归模型内存需求的方法,有可能在硬件受限的情况下实现更大的模型或更快的生成。

排序理由 该集群包含一篇 arXiv 论文,详细介绍了一种新的模型压缩技术方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

HeatKV 方法压缩视觉自回归模型 KV 缓存

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Pontus Giselsson ·

    HeatKV:面向视觉自回归建模的头调优 KV 缓存压缩

    Visual Autoregressive (VAR) models have recently demonstrated impressive image generation quality while maintaining low latency. However, they suffer from severe KV-cache memory constraints, often requiring gigabytes of memory per generated image. We introduce HeatKV, a novel com…