研究人员开发了一种新颖的方法来压缩全双工语音模型中的键值(KV)状态,显著减少了长时交互期间的内存使用。该技术被称为声学到文本 KV 压缩,在处理“空闲”时间内将传入语音转换为紧凑的文本格式。使用 MiniCPM-o 4.5 和 LoRA 实现该方法后,在十分钟的会话中,峰值流式 KV 缓存大小减少了 64.6%。该方法在转录、时间问答和摘要方面也表现出改进,同时在停顿处理、轮流对话和打断方面保持了可比的性能。 AI
影响 降低了长上下文语音模型的内存需求,可能支持更高效的实时应用。
排序理由 学术论文,详细介绍了一种提高 AI 模型效率的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →