VoiceBank+DEMAND
PulseAugur coverage of VoiceBank+DEMAND — every cluster mentioning VoiceBank+DEMAND across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
RT-SEMamba:基于Mamba的新模型提供实时语音增强
研究人员开发了RT-SEMamba,一种利用因果时频Mamba块的新型实时语音增强模型。与需要不断增长的键值缓存的Transformer模型不同,该架构通过传播固定大小的循环状态,为长格式推理提供了内存和带宽效率。采用渐进式知识蒸馏策略将一个8层教师模型压缩到一个1层学生模型,在保持竞争力的质量的同时实现了显著的加速。
-
新研究探索用于语音增强的视听和流匹配技术
两篇新研究论文探索了使用生成模型进行语音增强的高级技术。第一篇论文介绍了视听对比对齐(AVCA),通过强制更强的视听相关性来改进基于扩散的语音增强,在干扰抑制和信号重建方面显示出优势,尤其是在低信噪比下。第二篇论文提出了一种新颖的无跳跃骨干网络用于流匹配语音增强,通过与Descript Audio Codec的潜在表示对齐(LRA)进行指导,旨在保留清晰语音表示并实现高效的几步推理。
-
新的QC-GAN提供参数高效的语音增强
研究人员开发了QC-GAN,一种新的参数高效语音增强框架,它结合了四元数Conformer生成器和基于MetricGAN的训练。该方法利用Hamilton乘积来编码幅度和相位,在保持相互依赖性的同时显著减少了参数数量。一个度量学习判别器优化了感知质量,在VoiceBank+DEMAND数据集上仅用0.89M参数就达到了3.48的PESQ分数,一个拥有35K参数的较小变体也表现出强劲的性能。该模型在DNS-Challenge 3数据集上…
-
新型BASENet架构通过频带自适应处理增强语音
研究人员开发了BASENet,一种新颖的语音增强网络,它根据不同频带的感知重要性来调整其处理能力。该架构为对人类听觉更关键的低频分配更多资源,为高频分配较少资源。该网络包含一个跨频带注意力机制,以有效地捕捉频带间的谐波关系。与现有方法相比,BASENet在参数和计算资源显著减少的情况下,展现了最先进的性能,使其适用于资源受限设备上的实时应用。
-
DriftSE框架使用生成模型提供一步式语音增强
研究人员推出了一种新的生成式语音增强框架DriftSE,该框架通过一步推理绕过了迭代采样。这种新颖的方法将去噪表述为一个平衡问题,使用学习到的“漂移场”将样本直接引导至干净语音分布。在VoiceBank-DEMAND基准上的实验表明,DriftSE在保真度和速度上均优于多步扩散模型,有可能为该领域建立新的范式。