Neural Audio Codecs
PulseAugur coverage of Neural Audio Codecs — every cluster mentioning Neural Audio Codecs across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究比较语音合成内容表示
一项新发表在arXiv上的研究探讨了语音合成的各种内容表示,比较了它们在语音转换、语音到语音翻译和多模态语言模型中的有效性。研究人员仅根据不同的表示(包括SSL特征、监督令牌、后验图和神经音频编解码器)训练了生成模型。研究结果表明,一些表示在重建原始音频方面表现出色,而另一些则能有效地分离说话人身份,这表明信息容量和训练目标在实现这种分离方面起着至关重要的作用。
-
新研究探索使用神经音频编解码器进行高级语音增强 · 跟踪 2 个来源
两篇新研究论文探讨了用于语音增强的高级技术,重点关注在挑战性声学条件下提高音频质量的方法。第一篇论文介绍了一种测试时自适应方法,该方法使用从神经音频编解码器派生的自回归先验来正则化语音增强模型,显示出在训练和测试条件不同时尤其得到改善的质量。第二篇论文提出了一种掩码自回归语音增强方法,该方法利用神经音频编解码器的连续潜在表示,展示了性能和计算成本之间的灵活权衡。
-
神经音频编解码器令牌显示出类似语言的统计特性
一篇新论文分析了神经音频编解码器生成的令牌的统计特性,发现这些序列表现出类似语言的特征。该研究评估了13种不同的神经音频编解码器在各种语料库和噪声条件下的表现,采用了Zipf和Heaps参数、unigram熵和Jensen-Shannon散度等指标。结果表明,声学条件和使用的量化器类型显著影响这些指标,其中unigram熵对量化器的元类别特别敏感。研究还确定了在噪声条件下与不同编解码器架构相关的特定退化特征,如崩溃和爆炸。
-
语音学习模型在预训练中表现出语言依赖性,而非编解码器依赖性
一篇新的研究论文探讨了使用神经音频编解码器令牌的自监督学习(SSL)模型的语言敏感性。研究发现,虽然这些基于编解码器的SSL模型的性能不受用于训练神经音频编解码器本身的语言的显著影响,但它高度依赖于用于SSL预训练的语言。这表明单个神经音频编解码器可以有效地跨不同语言重复使用,但将SSL预训练语言与目标语言对齐对于获得最佳结果至关重要。
-
新的“Equalizer”方法通过分离信号增益和形状来增强神经音频编解码器
研究人员为神经音频编解码器(NAC)引入了一种名为“The Equalizer”的新方法,该方法将信号的能量(增益)与其结构(形状)分离开来。这种分解旨在提高对输入信号电平变化的鲁棒性,而这些变化目前会导致现有NAC效率低下和性能不佳。通过对形状向量进行NAC处理,并将增益单独传输,这种方法有望在比特率-失真性能方面取得显著的提升,并降低量化器的复杂性,实验已在四个主流语音编解码器上进行了验证。
-
空间音频模型无法编码相位,依赖于干扰
一篇新发表在arXiv上的论文探讨了当前空间音频基础模型的局限性,发现它们通常依赖于光谱-时域干扰而非精确的相位编码来进行定位任务。研究人员开发了一个使用双耳掩蔽声级差(BMLD)的心理声学基准来测试九种不同的音频模型。虽然专门的双耳空间模型显示出与分析基线相当的BMLD,但通用双耳模型则表现出对干扰纹理的依赖,这表明其性能指标中可能存在混淆因素。
-
神经音频编解码器在低至1.6赫兹时仍能实现平滑降级
研究人员探究了神经音频编解码器在低帧率下的性能衰减机制,低帧率有利于自回归语音合成。他们的研究发现,之前观察到的6.25赫兹时的质量断崖并非由音素冲突或码本饱和引起,而是由于训练配置不当。通过纠正此配置,词错误率平滑降级至1.6赫兹,表明低帧率编解码器的效率提升比之前认为的更容易实现。