PulseAugur
中
实时 00:46:35
English(EN) Acoustic-to-Text KV Compression for Full-Duplex Speech Models

语音模型通过新的文本压缩技术实现 64% 的 KV 缓存缩减

研究人员开发了一种新颖的方法来压缩全双工语音模型中的键值(KV)状态,显著减少了长时交互期间的内存使用。该技术被称为声学到文本 KV 压缩,在处理“空闲”时间内将传入语音转换为紧凑的文本格式。使用 MiniCPM-o 4.5 和 LoRA 实现该方法后,在十分钟的会话中,峰值流式 KV 缓存大小减少了 64.6%。该方法在转录、时间问答和摘要方面也表现出改进,同时在停顿处理、轮流对话和打断方面保持了可比的性能。 AI

影响 降低了长上下文语音模型的内存需求,可能支持更高效的实时应用。

排序理由 学术论文,详细介绍了一种提高 AI 模型效率的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

语音模型通过新的文本压缩技术实现 64% 的 KV 缓存缩减

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yejin Lee, Seungbeom Kim, Yongha Lee, Kyuhong Shim ·

    全双工语音模型的声学到文本键值压缩

    arXiv:2609.31224v1 Announce Type: cross Abstract: Full-duplex speech language models continuously accumulate acoustic key-value (KV) states, making long-running interactions memory-intensive. During listening, the model can finish processing an audio unit before the next arrives;…