研究人员开发了一种新颖的音素引导初始化方法,以提高大型语言模型(LLM)在自动语音识别(ASR)中的性能,尤其是在低资源场景下。该方法在端到端微调之前,先在语音到音素(S2P)任务上预训练音频编码器,在音素到字形(P2G)任务上预训练LLM。在日本、中文、鞑靼语和乌尔都语等多种语言的实验表明,该方法可以媲美或超越现有的级联和端到端ASR模型。此外,在多语言LLM驱动的ASR P2G方面也取得了进展,重点在于处理S2P不确定性和数据不平衡的鲁棒性策略,从而在CV-Lang10等基准测试中降低了词错误率。 AI
影响 提高了LLM在低资源语音识别中的性能,并推进了多语言P2G能力。
排序理由 两篇arXiv论文详细介绍了改进LLM语音识别的新方法。
- arXiv
- CV-Lang10
- Hugging Face
- Japanese
- LLM
- phoneme-guided initialization
- phoneme-to-grapheme (P2G)
- speech-to-phoneme (S2P)
- Chinese
- Tatar
- Urdu
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →