研究人员为多语言对话语音语言模型(MLC-SLM)挑战赛开发了一个名为SEAR的系统,准确率达到90.92%。该系统通过将ASR转录转换为事件跨度来调整Qwen3-Omni-30B-A3B-Instruct模型,然后利用这些跨度来合成语义和声学选择题。这些选择题使用Qwen3.6-27B生成语义选择题,使用Gemini 3.1 Flash-Lite生成声学选择题,并经过严格的验证步骤确保数据质量。 AI
影响 这项研究推进了多语言语音理解和语言模型数据合成的技术。
排序理由 该项目是一篇研究论文,详细介绍了一个用于特定挑战的系统。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Gemini 3.1 Flash-Lite
- Group Sequence Policy Optimization
- MLC-SLM Challenge
- Qwen3.6-27B
- Qwen3-Omni-30B-A3B-Instruct
- SEAR
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →