PulseAugur
实时 09:16:27
English(EN) Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

新的潜在 Softmax 提高了多语言自动语音识别的数据效率

研究人员开发了一种名为潜在 Softmax 的新输出层,用于多语言自动语音识别 (ASR) 系统。该方法旨在通过更好地处理音调语言和非音调语言之间不同的监督粒度来提高数据效率。实验表明,潜在 Softmax 降低了音素错误率,并为音素到字素转换等下游任务带来了持续的词错误率提升。 AI

影响 这种新方法有望带来更高效、更准确的多语言语音识别系统,尤其是在有音调变化的语言方面。

排序理由 该集群包含一篇详细介绍 ASR 新方法的学术论文。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的潜在 Softmax 提高了多语言自动语音识别的数据效率

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Saierdaer Yusuyin, Nanling Jiang, Hao Huang, Zhijian Ou ·

    Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

    arXiv:2608.01281v1 Announce Type: cross Abstract: Phoneme-based multilingual automatic speech recognition (ASR) can share acoustic evidence across languages more directly than language-specific subword modeling. When tonal and non-tonal languages are jointly trained, however, the…