研究人员开发了MEUSLI,这是一种新颖的多语言投影仪,旨在将语音编码器与大语言模型(LLM)连接起来,以完成高级语音处理任务。该系统扩展了现有的单语投影仪,支持28种欧洲语言的端到端自动语音识别(ASR),并且可以进一步适应其他语言。MEUSLI还展示了超越ASR的能力,只需极少的特定任务监督即可实现多语言语音翻译和主题识别。 AI
影响 推进了多语言语音理解和翻译能力,有可能拓宽基于LLM的语音技术的获取途径。
排序理由 该集群描述了详细介绍使用LLM进行多语言语音处理的新方法和系统的新研究论文。
- arXiv
- Audio-MLQA
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- MEUSLI
- Q-Former
- ScienceCast
- SpeechLLM
- Whisper
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →