PulseAugur
实时 00:39:40
实体 Neural Audio Codecs

Neural Audio Codecs

PulseAugur coverage of Neural Audio Codecs — every cluster mentioning Neural Audio Codecs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_171846 ·

    语音学习模型在预训练中表现出语言依赖性,而非编解码器依赖性

    一篇新的研究论文探讨了使用神经音频编解码器令牌的自监督学习(SSL)模型的语言敏感性。研究发现,虽然这些基于编解码器的SSL模型的性能不受用于训练神经音频编解码器本身的语言的显著影响,但它高度依赖于用于SSL预训练的语言。这表明单个神经音频编解码器可以有效地跨不同语言重复使用,但将SSL预训练语言与目标语言对齐对于获得最佳结果至关重要。

  2. TOOL · CL_167499 ·

    新的“Equalizer”方法通过分离信号增益和形状来增强神经音频编解码器

    研究人员为神经音频编解码器(NAC)引入了一种名为“The Equalizer”的新方法,该方法将信号的能量(增益)与其结构(形状)分离开来。这种分解旨在提高对输入信号电平变化的鲁棒性,而这些变化目前会导致现有NAC效率低下和性能不佳。通过对形状向量进行NAC处理,并将增益单独传输,这种方法有望在比特率-失真性能方面取得显著的提升,并降低量化器的复杂性,实验已在四个主流语音编解码器上进行了验证。

  3. TOOL · CL_93224 ·

    空间音频模型无法编码相位,依赖于干扰

    一篇新发表在arXiv上的论文探讨了当前空间音频基础模型的局限性,发现它们通常依赖于光谱-时域干扰而非精确的相位编码来进行定位任务。研究人员开发了一个使用双耳掩蔽声级差(BMLD)的心理声学基准来测试九种不同的音频模型。虽然专门的双耳空间模型显示出与分析基线相当的BMLD,但通用双耳模型则表现出对干扰纹理的依赖,这表明其性能指标中可能存在混淆因素。

  4. RESEARCH · CL_93405 ·

    神经音频编解码器在低至1.6赫兹时仍能实现平滑降级

    研究人员探究了神经音频编解码器在低帧率下的性能衰减机制,低帧率有利于自回归语音合成。他们的研究发现,之前观察到的6.25赫兹时的质量断崖并非由音素冲突或码本饱和引起,而是由于训练配置不当。通过纠正此配置,词错误率平滑降级至1.6赫兹,表明低帧率编解码器的效率提升比之前认为的更容易实现。