研究人员通过收集和整理超过 17 小时的语音数据,为资源匮乏的米佐语开发了一个新的自动语音识别 (ASR) 系统。他们微调了三个 Whisper 多语言模型和 SraVaani 1.0 印度多语言模型。Whisper-large-v3 模型在常规评估中实现了 18.08% 的最低词错误率 (WER),在形态感知评估中为 7.22%。虽然 SraVaani 1.0 的初始 WER 较高,但微调显著提高了其性能,证明了适应性模型对未见语言的有效性。 AI
影响 提高了低资源语言的语音技术的可访问性,可能为米佐语使用者带来新的应用。
排序理由 该集群描述了一篇研究论文,详细介绍了为低资源语言创建和评估语音语料库以及微调 ASR 模型。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →