研究人员开发了MEUSLI,这是一种新颖的多语言投影仪,旨在将语音编码器与大型语言模型(LLMs)连接起来,以进行高级语音处理任务。该系统通过支持28种欧洲语言的端到端自动语音识别(ASR)来扩展现有的单语投影仪,并且可以进一步适配其他语言。MEUSLI还展示了超越ASR的能力,能够以最小的任务特定监督来促进多语言语音翻译和主题识别。 AI
影响 推动了多语言语音理解和翻译能力的发展,有可能拓宽基于LLM的语音技术的应用范围。
排序理由 该集群描述了关于使用LLMs进行多语言语音处理的新方法和系统的研究论文。
- arXiv
- Audio-MLQA
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- MEUSLI
- Q-Former
- ScienceCast
- SpeechLLM
- Whisper
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →