研究人员开发了X2Streaming-ASR,这是一种用于流式自动语音识别(ASR)的新型系统,专为实时应用而设计。与使用固定块大小或目标延迟的现有方法不同,X2Streaming-ASR优化了何时提交部分转录内容以及使用何种上下文。这种三阶段训练方法显著降低了提交延迟,在AISHELL-1/2/3和WenetSpeech等基准数据集上低至27-84毫秒,同时与基线系统相比,字符错误率也有所提高。 AI
影响 这种新的流式ASR方法可以实现更具响应性和准确性的实时语音代理和对话系统。
排序理由 该集群包含一篇详细介绍自动语音识别新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →