Pesquet
PulseAugur coverage of Pesquet — every cluster mentioning Pesquet across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新协议揭示语音质量指标极易被攻击
一篇新发表在arXiv上的研究论文详细介绍了一个用于评估语音质量指标可攻击性的修正协议。该研究指出了现有测量方法的缺陷,例如将神经编解码器的扰动效应归因于攻击本身,以及依赖单一训练攻击者。使用提出的协议,研究人员发现四个已发布的预测器在可攻击性方面存在显著差异,其中NISQA最易受攻击,UTMOS最不容易。论文还考察了一个封闭的攻击-检测-修补循环,得出结论认为它提供的加固效果有限,并且不如随机扰动基线有效。
-
新的SemDAC方法通过语义条件化提升语音压缩效果
研究人员开发了一种新颖的神经语音压缩方法SemDAC,该方法优先考虑语义内容而非波形保真度。通过引入源自HuBERT特征的分层语义条件化,SemDAC在较低比特率下实现了比现有方法显著更高的压缩效率和识别鲁棒性。这种方法将重建引导至关键的语音信息,在各种客观和主观质量指标上优于更高比特率的基线。
-
AI通过新型Transformer模型增强射频干扰抑制
研究人员开发了一种AI增强的射频(RF)干扰抑制方法,该方法建立在先前的自回归Transformer模型之上。这种新方法包含了一个有限标量量化(FSQ)分词器层,以提高干扰抑制性能并最小化延迟。实验表明,这种AI赋能的技术在抑制数字电视信号(一种常见的正交频分复用(OFDM)传输类型)方面,优于传统方法和先前AI方法,其衡量标准是感知语音质量评估(PESQ)等音频指标。该研究还探讨了推理优化技术,以在不显著损失准确性的情况下进一步加快…
-
新的QC-GAN提供参数高效的语音增强
研究人员开发了QC-GAN,一种新的参数高效语音增强框架,它结合了四元数Conformer生成器和基于MetricGAN的训练。该方法利用Hamilton乘积来编码幅度和相位,在保持相互依赖性的同时显著减少了参数数量。一个度量学习判别器优化了感知质量,在VoiceBank+DEMAND数据集上仅用0.89M参数就达到了3.48的PESQ分数,一个拥有35K参数的较小变体也表现出强劲的性能。该模型在DNS-Challenge 3数据集上…