阿里巴巴的 Qwen 团队推出了 Qwen-Audio-3.0-ASR,一个基于混合专家(Mixture-of-Experts)大型语言模型的新型自动语音识别系统。该模型旨在通过处理多样的方言、动态实体和长距离上下文来提高实际应用效用。它支持 30 种语言和 16 种中文方言的转录,并提供行业领域实体识别和分层热词定制等功能。还提供了一个流式版本 Qwen-Audio-3.0-ASR-Streaming,用于低延迟应用,评估显示其性能与 GPT-4o Transcribe 和 Gemini 3.1 Pro 等系统相比具有竞争力。 AI
影响 增强了实际语音识别能力,可能改进需要方言理解和长上下文处理的应用。
排序理由 发布关于新型 ASR 系统的技术报告。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →