XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale
PulseAugur coverage of XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale — every cluster mentioning XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale across labs, papers, and developer communities, ranked by signal.
-
Transformer模型在古兰经自动语音识别方面准确性有所提高
研究人员对用于古兰经自动语音识别(ASR)的预训练Transformer模型进行了比较研究,旨在降低用户诵读经文时的高词错误率(WER)。该研究在870小时的古兰经数据集上微调了Wav2Vec2.0、HuBERT和XLS-R等模型,确定了转录准确性的关键因素。最佳配置在EveryAyah子集上实现了0.08的WER,相比Citrinet基线有了显著改进,同时还缩短了训练时间。
-
新指标评估英语到中文S2ST中的词重音
研究人员开发了一种新的方法来评估和保留英语到中文语音到语音翻译(S2ST)中的词重音。他们创建了一个带重音标注的中文数据集和一个使用XLS-R的普通话重音检测器,并将其与英文EmphAssess系统集成,提出了一个新的跨语言重音评估客观指标。经过微调的CosyVoice3系统在保持翻译质量的同时,展示了改进的重音翻译能力,并且新的评估指标与人类判断显示出很强的相关性。
-
新研究利用先进的AI模型解决欺骗语音检测问题
研究人员正在开发先进的方法来检测欺骗语音,由于逼真的合成和语音转换技术,这是一个日益严峻的挑战。一种方法是时间金字塔适配器(Temporal Pyramid Adapter),它使用具有不同感受野的并行时间卷积来捕获多尺度欺骗线索,并整合XLS-R等自监督表示。另一项研究推出了ArFake,这是第一个多方言阿拉伯语欺骗语音数据集,以解决该领域有限的研究。第三篇论文将自监督语音模型转换为专家混合(Mixture-of-Experts)架…
-
研究人员探索量子和深度学习在音频深度伪造检测中的应用
提交给2026年环境感知语音和声音深度伪造检测挑战赛(ESDD2)的两篇研究论文提出了新颖的深度学习框架,用于检测经过篡操纵的音频。第一篇论文介绍了一个双分支系统,使用预训练模型XLS-R和BEATs分别分析语音和环境声音,达到了70.20%的F1分数。第二篇论文探讨了各种深度学习架构和预训练模型,发现使用三阶段策略对WavLM进行微调可获得更优异的结果,在一个基准数据集上取得了0.95的F1分数。