PulseAugur
实时 11:23:52
English(EN) RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

RT-SEMamba:基于Mamba的新模型提供实时语音增强

研究人员开发了RT-SEMamba,一种利用因果时频Mamba块的新型实时语音增强模型。与需要不断增长的键值缓存的Transformer模型不同,该架构通过传播固定大小的循环状态,为长格式推理提供了内存和带宽效率。采用渐进式知识蒸馏策略将一个8层教师模型压缩到一个1层学生模型,在保持竞争力的质量的同时实现了显著的加速。 AI

影响 这项研究展示了一种更高效的实时语音增强架构,有望在语音助手和通信工具中提高性能。

排序理由 该集群包含一篇详细介绍新模型架构及其在基准数据集上性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

RT-SEMamba:基于Mamba的新模型提供实时语音增强

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Rong Chao, Sung-Feng Huang, Moreno La Quatra, Sabato Marco Siniscalchi, Wen-Huang Cheng, Szu-Wei Fu, Yu Tsao ·

    RT-SEMamba:通过渐进式知识蒸馏实现实时语音增强Mamba

    arXiv:2608.12099v1 Announce Type: cross Abstract: We present RT-SEMamba, a fully causal speech enhancement (SE) model built upon causal time-frequency Mamba blocks. Unlike Transformer-based architectures that rely on a growing key-value cache, Mamba propagates a fixed-size recurr…