一项新研究使用标准化的微调协议,对尼泊尔自动语音识别(ASR)的六个多语言预训练模型进行了基准测试。研究发现,Whisper-Large-v3-Turbo 和 IndicWav2Vec 的表现相当,表明预训练中的语系接近性对于尼泊尔ASR可以与单纯的规模一样有效。研究还强调,与Whisper等自回归模型相比,CTC解码器在相似的准确度水平下提供了显著更快的性能,因此对于有延迟限制的应用来说是更可取的。这项工作为尼泊尔ASR提供了第一个标准化的、多模型的、考虑效率的参考数字。 AI
影响 为尼泊尔ASR提供了标准化的基准,指导模型在效率和准确性方面的选择。
排序理由 该集群包含一篇学术论文,详细介绍了AI模型的比较分析和基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
- Common Voice
- Conformer-Hi
- IndicWav2Vec
- MMS-1B
- OpenSLR SLR54
- Open Speech and Language Resources
- Whisper Large v3 Turbo
- Whisper-medium
- XLSR-53
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →