PulseAugur
中
实时 22:14:25
实体 XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale

XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale

PulseAugur coverage of XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale — every cluster mentioning XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_257056 ·

    新的SITA方法改进了语调语言的语音表示

    研究人员开发了SITA,这是一种新颖的自监督语音编码器自适应方法,旨在改进低资源语调语言的表示学习。SITA采用分阶段优化框架,结合了跨性别对比损失和音调排斥损失,以增强说话人不变性同时保留词汇音调。该方法还结合了CTC微调和知识蒸馏,以恢复面向识别的语言信息。在苗语和标准汉语上的评估表明,与现有基线相比,SITA在音调分离和自动语音识别(ASR)准确性之间实现了更优的权衡。

  2. TOOL · CL_254537 ·

    Neyshekar 语料库发布,用于波斯语语音识别

    一个名为 Neyshekar 的新的开放式波斯语朗读语音语料库已发布,包含超过 62,000 条录音,总计近 100 小时。该语料库旨在涵盖正式和非正式的波斯语、命名实体和较长的发音,由 190 人贡献。数据使用 'shekar' 库进行处理以进行标准化,并包含详细的特征,如录音负荷和信号质量。评估表明,与现有的波斯语数据集相比,Neyshekar 显著降低了 Whisper 和 XLS-R 等自动语音识别架构的词错误率 (WER) …

  3. TOOL · CL_100071 ·

    Transformer模型在古兰经自动语音识别方面准确性有所提高

    研究人员对用于古兰经自动语音识别(ASR)的预训练Transformer模型进行了比较研究,旨在降低用户诵读经文时的高词错误率(WER)。该研究在870小时的古兰经数据集上微调了Wav2Vec2.0、HuBERT和XLS-R等模型,确定了转录准确性的关键因素。最佳配置在EveryAyah子集上实现了0.08的WER,相比Citrinet基线有了显著改进,同时还缩短了训练时间。

  4. TOOL · CL_93517 ·

    新指标评估英语到中文S2ST中的词重音

    研究人员开发了一种新的方法来评估和保留英语到中文语音到语音翻译(S2ST)中的词重音。他们创建了一个带重音标注的中文数据集和一个使用XLS-R的普通话重音检测器,并将其与英文EmphAssess系统集成,提出了一个新的跨语言重音评估客观指标。经过微调的CosyVoice3系统在保持翻译质量的同时,展示了改进的重音翻译能力,并且新的评估指标与人类判断显示出很强的相关性。

  5. RESEARCH · CL_91207 ·

    新研究利用先进的AI模型解决欺骗语音检测问题

    研究人员正在开发先进的方法来检测欺骗语音,由于逼真的合成和语音转换技术,这是一个日益严峻的挑战。一种方法是时间金字塔适配器(Temporal Pyramid Adapter),它使用具有不同感受野的并行时间卷积来捕获多尺度欺骗线索,并整合XLS-R等自监督表示。另一项研究推出了ArFake,这是第一个多方言阿拉伯语欺骗语音数据集,以解决该领域有限的研究。第三篇论文将自监督语音模型转换为专家混合(Mixture-of-Experts)架…

  6. RESEARCH · CL_15484 ·

    研究人员探索量子和深度学习在音频深度伪造检测中的应用

    提交给2026年环境感知语音和声音深度伪造检测挑战赛(ESDD2)的两篇研究论文提出了新颖的深度学习框架,用于检测经过篡操纵的音频。第一篇论文介绍了一个双分支系统,使用预训练模型XLS-R和BEATs分别分析语音和环境声音,达到了70.20%的F1分数。第二篇论文探讨了各种深度学习架构和预训练模型,发现使用三阶段策略对WavLM进行微调可获得更优异的结果,在一个基准数据集上取得了0.95的F1分数。