研究人员推出了一种新颖的端到端自动语音识别(ASR)架构Xiaomi-CocktailASR-1,旨在解决多说话人环境中的“鸡尾酒会问题”。该基于LLM的系统利用声纹提示,无需预先分离即可转录目标说话人的语音,同时保持具有竞争力的单说话人性能,并增加了对缺席目标说话人的关键拒绝能力。该架构还支持链式思考(Chain-of-Thought)推理模式,并在各种基准测试中取得了最先进的结果。 AI
影响 该模型有望显著提高在嘈杂、多说话人环境下的ASR性能,造福于语音助手和转录服务等应用。
排序理由 该集群包含一篇在arXiv上发表的技术报告,详细介绍了用于自动语音识别的新模型架构。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →