PulseAugur
实时 09:22:29
English(EN) VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip框架将音频大模型键值缓存需求降低20倍

研究人员开发了VoxZip,一个新颖的两阶段框架,旨在压缩语音大模型中长上下文音频推理的键值缓存。该方法使用自动语音识别(ASR)转录作为语义锚点来对齐和压缩音频令牌,然后采用动态过滤策略移除非必需令牌。在Qwen3-Omni上的评估表明,VoxZip可以在长上下文场景下实现20倍的键值缓存压缩,同时保持超过90%的未压缩基线性能;在4倍压缩下,它可将推理吞吐量提高1.9倍,并将内存开销降低3.3倍。 AI

影响 这项压缩技术可以显著降低部署大型音频语言模型的计算成本和内存需求,从而提高可访问性并实现更高效的实时应用。

排序理由 详细介绍一种优化大模型推理新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

VoxZip框架将音频大模型键值缓存需求降低20倍

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin ·

    VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

    arXiv:2608.08569v1 Announce Type: new Abstract: Recent advancements in Speech Large Language Models have demonstrated remarkable capabilities in understanding complex audio tasks. Despite this progress, their long-context inference remains severely bottlenecked by prohibitive KV …