PulseAugur
实时 01:22:14
中文(ZH) 长音频不丢词,行业词不用教,阿里发布Qwen-Audio-3.0-ASR-Flash

Alibaba发布Qwen-Audio-3.0-ASR-Flash,增强上下文和行业术语识别能力

Alibaba发布了升级版语音识别模型Qwen-Audio-3.0-ASR-Flash。新版本增强了长音频的上下文一致性,无需手动列表即可识别行业特定术语,并为常用术语提供更准确的定制。此外,该模型现在可以执行语音优化,一步完成去除填充词和将口语结构化为连贯文本。 AI

影响 此次发布提高了语音转文本应用的准确性和效率,尤其适用于长篇内容和专业行业。

排序理由 Frontier-lab模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 雷峰网 (Leiphone) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Alibaba发布Qwen-Audio-3.0-ASR-Flash,增强上下文和行业术语识别能力

报道来源 [1]

  1. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    长音频无字损,行业术语无需教,阿里巴巴发布Qwen-Audio-3.0-ASR-Flash

    <p>7月31日,阿里巴巴发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度系统性升级,同时具备语音润色能力,可直接输出结构化文本。</p><p>目前,Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中获得广泛验证,离线版本曾在全球权威AI评测平台Artificial Analysis以1.7%的错字率位列全球第一。识准专业词汇,是ASR模型走向行业落地的最后一公里,也是本次升级的核心。全新升级的3.0版本,聚焦通用的语音识别能力,不止于把每个字听对,更要…