Libri2Mix
PulseAugur coverage of Libri2Mix — every cluster mentioning Libri2Mix across labs, papers, and developer communities, ranked by signal.
-
新的自回归模型实现实时说话人提取
研究人员开发了一种新的自回归模型,用于流式目标说话人提取,解决了当前生成模型在实时应用中遇到的局限性。他们的方法,即逐块交错拼接范式,通过利用历史上下文来精炼提取的语音片段并减轻不连续性,从而确保了稳定高效的流式推理。在Libri2Mix上的实验表明,该方法即使在低延迟下也能保持稳定性和卓越的清晰度,甚至超越了离线基线,在消费级GPU上实现了0.248的实时因子。
-
新型TF-MoE语音分离模型优化用于边缘设备
研究人员推出了一种新颖的稀疏专家混合(Mixture-of-Experts)框架TF-MoE,旨在改进用于边缘设备的语音分离模型。该方法在时间和频率维度上使用动态专家专业化,从而在对推理成本影响极小的情况下增加模型容量。TF-MoE基于Conformer骨干网络构建,在低计算场景下表现出卓越的性能,在Libri2Mix等基准测试中优于BSRNN等现有方法,同时保持可比的计算效率。
-
TF-MoE框架增强了用于边缘设备的语音分离模型
研究人员开发了TF-MoE,一种新颖的专家混合(Mixture-of-Experts)框架,旨在提高语音分离模型的性能,同时最小化计算成本。该方法实现了跨时间和频率维度的动态专家专业化,从而在不显著增加推理成本的情况下提高了模型容量。TF-MoE在低计算条件下,在Libri2Mix数据集上表现优于BSRNN等现有方法,显示出有希望的结果,使其适合部署在边缘设备上。
-
语音分离研究揭示SI-SDR在带噪声参考信号下的局限性
研究人员调查了在训练数据包含带噪声参考信号时,尺度不变信噪比失真比(SI-SDR)在语音分离中的有效性。他们的分析显示,参考信号中的噪声会限制可实现的SI-SDR,并将不必要的噪声引入分离后的输出。为缓解此问题,他们提出了一种增强参考信号和扩充训练数据的方法,该方法显示出噪声减少,但也可能产生处理伪影。