PulseAugur
实时 18:36:24
实体 BSRNN

BSRNN

PulseAugur coverage of BSRNN — every cluster mentioning BSRNN across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_135340 ·

    新的PS4框架增强了从真实对话中提取说话人的能力

    研究人员开发了一个名为PS4的新框架,用于在真实的对话音频上训练目标说话人提取(TSE)模型。该方法通过构建一个包含71,000多个样本的语料库来解决大规模、干净的训练数据缺乏的问题。PS4框架采用代理监督联合训练策略,包含自动语音识别、说话人相似度、语音活动检测和感知音频质量四个目标,以微调基于BSRNN的模型。该方法在REAL-T挑战排行榜上获得第二名,在说话人相似度和时序方面表现强劲。

  2. TOOL · CL_117643 ·

    新型TF-MoE语音分离模型优化用于边缘设备

    研究人员推出了一种新颖的稀疏专家混合(Mixture-of-Experts)框架TF-MoE,旨在改进用于边缘设备的语音分离模型。该方法在时间和频率维度上使用动态专家专业化,从而在对推理成本影响极小的情况下增加模型容量。TF-MoE基于Conformer骨干网络构建,在低计算场景下表现出卓越的性能,在Libri2Mix等基准测试中优于BSRNN等现有方法,同时保持可比的计算效率。

  3. TOOL · CL_126251 ·

    TF-MoE框架增强了用于边缘设备的语音分离模型

    研究人员开发了TF-MoE,一种新颖的专家混合(Mixture-of-Experts)框架,旨在提高语音分离模型的性能,同时最小化计算成本。该方法实现了跨时间和频率维度的动态专家专业化,从而在不显著增加推理成本的情况下提高了模型容量。TF-MoE在低计算条件下,在Libri2Mix数据集上表现优于BSRNN等现有方法,显示出有希望的结果,使其适合部署在边缘设备上。