Neural Audio Codecs
PulseAugur coverage of Neural Audio Codecs — every cluster mentioning Neural Audio Codecs across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
语音学习模型在预训练中表现出语言依赖性,而非编解码器依赖性
一篇新的研究论文探讨了使用神经音频编解码器令牌的自监督学习(SSL)模型的语言敏感性。研究发现,虽然这些基于编解码器的SSL模型的性能不受用于训练神经音频编解码器本身的语言的显著影响,但它高度依赖于用于SSL预训练的语言。这表明单个神经音频编解码器可以有效地跨不同语言重复使用,但将SSL预训练语言与目标语言对齐对于获得最佳结果至关重要。
-
新的“Equalizer”方法通过分离信号增益和形状来增强神经音频编解码器
研究人员为神经音频编解码器(NAC)引入了一种名为“The Equalizer”的新方法,该方法将信号的能量(增益)与其结构(形状)分离开来。这种分解旨在提高对输入信号电平变化的鲁棒性,而这些变化目前会导致现有NAC效率低下和性能不佳。通过对形状向量进行NAC处理,并将增益单独传输,这种方法有望在比特率-失真性能方面取得显著的提升,并降低量化器的复杂性,实验已在四个主流语音编解码器上进行了验证。
-
空间音频模型无法编码相位,依赖于干扰
一篇新发表在arXiv上的论文探讨了当前空间音频基础模型的局限性,发现它们通常依赖于光谱-时域干扰而非精确的相位编码来进行定位任务。研究人员开发了一个使用双耳掩蔽声级差(BMLD)的心理声学基准来测试九种不同的音频模型。虽然专门的双耳空间模型显示出与分析基线相当的BMLD,但通用双耳模型则表现出对干扰纹理的依赖,这表明其性能指标中可能存在混淆因素。
-
神经音频编解码器在低至1.6赫兹时仍能实现平滑降级
研究人员探究了神经音频编解码器在低帧率下的性能衰减机制,低帧率有利于自回归语音合成。他们的研究发现,之前观察到的6.25赫兹时的质量断崖并非由音素冲突或码本饱和引起,而是由于训练配置不当。通过纠正此配置,词错误率平滑降级至1.6赫兹,表明低帧率编解码器的效率提升比之前认为的更容易实现。