PulseAugur
实时 10:29:41
实体 VoiceBank+DEMAND

VoiceBank+DEMAND

PulseAugur coverage of VoiceBank+DEMAND — every cluster mentioning VoiceBank+DEMAND across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_198170 ·

    RT-SEMamba:基于Mamba的新模型提供实时语音增强

    研究人员开发了RT-SEMamba,一种利用因果时频Mamba块的新型实时语音增强模型。与需要不断增长的键值缓存的Transformer模型不同,该架构通过传播固定大小的循环状态,为长格式推理提供了内存和带宽效率。采用渐进式知识蒸馏策略将一个8层教师模型压缩到一个1层学生模型,在保持竞争力的质量的同时实现了显著的加速。

  2. RESEARCH · CL_107740 ·

    新研究探索用于语音增强的视听和流匹配技术

    两篇新研究论文探索了使用生成模型进行语音增强的高级技术。第一篇论文介绍了视听对比对齐(AVCA),通过强制更强的视听相关性来改进基于扩散的语音增强,在干扰抑制和信号重建方面显示出优势,尤其是在低信噪比下。第二篇论文提出了一种新颖的无跳跃骨干网络用于流匹配语音增强,通过与Descript Audio Codec的潜在表示对齐(LRA)进行指导,旨在保留清晰语音表示并实现高效的几步推理。

  3. RESEARCH · CL_97802 ·

    新的QC-GAN提供参数高效的语音增强

    研究人员开发了QC-GAN,一种新的参数高效语音增强框架,它结合了四元数Conformer生成器和基于MetricGAN的训练。该方法利用Hamilton乘积来编码幅度和相位,在保持相互依赖性的同时显著减少了参数数量。一个度量学习判别器优化了感知质量,在VoiceBank+DEMAND数据集上仅用0.89M参数就达到了3.48的PESQ分数,一个拥有35K参数的较小变体也表现出强劲的性能。该模型在DNS-Challenge 3数据集上…

  4. TOOL · CL_86781 ·

    新型BASENet架构通过频带自适应处理增强语音

    研究人员开发了BASENet,一种新颖的语音增强网络,它根据不同频带的感知重要性来调整其处理能力。该架构为对人类听觉更关键的低频分配更多资源,为高频分配较少资源。该网络包含一个跨频带注意力机制,以有效地捕捉频带间的谐波关系。与现有方法相比,BASENet在参数和计算资源显著减少的情况下,展现了最先进的性能,使其适用于资源受限设备上的实时应用。

  5. RESEARCH · CL_06338 ·

    DriftSE框架使用生成模型提供一步式语音增强

    研究人员推出了一种新的生成式语音增强框架DriftSE,该框架通过一步推理绕过了迭代采样。这种新颖的方法将去噪表述为一个平衡问题,使用学习到的“漂移场”将样本直接引导至干净语音分布。在VoiceBank-DEMAND基准上的实验表明,DriftSE在保真度和速度上均优于多步扩散模型,有可能为该领域建立新的范式。