PulseAugur
实时 06:14:02
English(EN) A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation

使用 Whisper 和 SraVaani 模型微调的新米佐语 ASR 系统

研究人员通过收集和整理超过 17 小时的语音数据,为资源匮乏的米佐语开发了一个新的自动语音识别 (ASR) 系统。他们微调了三个 Whisper 多语言模型和 SraVaani 1.0 印度多语言模型。Whisper-large-v3 模型在常规评估中实现了 18.08% 的最低词错误率 (WER),在形态感知评估中为 7.22%。虽然 SraVaani 1.0 的初始 WER 较高,但微调显著提高了其性能,证明了适应性模型对未见语言的有效性。 AI

影响 提高了低资源语言的语音技术的可访问性,可能为米佐语使用者带来新的应用。

排序理由 该集群描述了一篇研究论文,详细介绍了为低资源语言创建和评估语音语料库以及微调 ASR 模型。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

使用 Whisper 和 SraVaani 模型微调的新米佐语 ASR 系统

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Priyankoo Sarmah, Sanasam Ranbir Singh, Lalhmingmawia ·

    用于米佐自动语音识别的语音语料库:使用感知形态学的Whisper和SraVaani 1.0微调及评估

    arXiv:2608.19361v1 Announce Type: new Abstract: This study reports the development of an Automatic Speech Recognition (ASR) system in Mizo, a low-resource language. The development included collecting 17.62 hours of speech data, curating it, and fine-tuning the Mizo ASR system wi…