Qwen3 ASR
PulseAugur coverage of Qwen3 ASR — every cluster mentioning Qwen3 ASR across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
研究揭示ASR往返评估掩盖了TTS阅读错误
一篇新发表在arXiv上的研究论文指出了自动语音识别(ASR)往返评估在评估中文新闻文本到语音(TTS)系统时的局限性。研究发现,该方法会掩盖上下文和约定相关的阅读错误,即TTS系统产生一个看似合理但发音错误的语音,而自动语音识别(ASR)系统仍能正确转录。对MiMo TTS和CosyVoice系统的审计揭示了大量此类被掩盖的错误,这表明ASR往返评估可用于初步筛选,但不足以作为评估中文新闻TTS阅读风险的唯一依据。
-
新的视听分割系统赢得LSVOS挑战赛
研究人员开发了一种新颖的视听分割系统,该系统涉及识别和分割视频中语音描述的对象。该系统首先使用Qwen3-ASR将语音转录为文本,然后使用互补的接地和分割模型生成多个视频掩码轨道。为了提高准确性,该系统会选择候选者中平均一致性最高的轨道,并对特定查询类型应用基于规则的校正。这种方法在第八届LSVOS挑战赛的MeViS-Audio赛道上取得了第一名。
-
开源 iOS 应用支持 iPhone 上的离线 AI 模型
一款名为 LiveTranscriber 的开源 iOS 应用程序已被开发出来,可在设备上完全运行各种语音和语言模型,从而在 iPhone 上实现离线功能。该应用程序支持 Whisper 进行转录、Qwen3-ASR 进行多语言识别、NVIDIA Nemotron Streaming 进行低延迟实时转录以及 MOSS Multi-Speaker 进行说话人感知转录等模型。主要功能包括离线摘要、实时翻译和可搜索的转录历史记录,主要的工程…
-
自托管开源语音转文本模型会产生隐藏成本
自托管开源语音转文本模型,如 Whisper Large V3、Qwen3 ASR 以及 NVIDIA 的 Parakeet 和 Canary,最初可能看起来是免费的,但其总体拥有成本却相当可观。除了模型权重之外,用户还必须考虑 GPU 基础设施的巨大开销,这通常涉及支付闲置时间费用或处理冷启动问题。此外,原始检查点缺乏关键的生产功能,例如准确的说话人分离和针对真实世界数据的可靠实体格式化,而这些功能通常包含在托管 API 提供商的服务中。
-
AssemblyAI 推 Universal-3.5 Pro 优于 Qwen3-ASR,适用于生产环境语音转文本
AssemblyAI 将其 Universal-3.5 Pro 语音转文本模型与阿里巴巴的 Qwen3-ASR 进行了比较,强调了其专有解决方案在生产环境中的优势。虽然 Qwen3-ASR 被认为是一个功能强大的多语言开源模型,但 AssemblyAI 认为,适用于生产环境的应用需要的不仅仅是准确的转录。据报道,Universal-3.5 Pro 在处理多语言代码切换方面表现出色,提供诸如说话人分离和实体识别等集成功能,并提供实时流式…
-
AssemblyAI:自托管 AI 模型比托管 API 成本更高
AssemblyAI 认为,虽然在 Baseten、Modal 或 Fireworks 等平台上自托管 Whisper 或 Qwen3-ASR 等开源语音模型在纸面上可能看起来成本效益高,但总体拥有成本通常高于使用托管 API。该公司强调了隐藏成本,包括 GPU 利用率、构建和维护核心模型之外的功能(如说话人分离或 PII 屏蔽)的需要,以及确保生产级可靠性和正常运行时间的负担。AssemblyAI 建议,自托管仅在大量离线批量处理或…
-
r/LocalLLaMA 用户寻求 ASR 和 TTS 模型推荐
r/LocalLLaMA 上的这篇 Reddit 帖子在征求自动语音识别 (ASR) 和文本转语音 (TTS) 模型推荐。原帖作者目前正在使用 Whisper 和 Kokoro 等旧模型配合 koboldcpp,并正在寻找更新、可能更好的替代品。他们提到了 Qwen3-ASR 和 Qwen3-TTS,但尚未测试过,并希望从社区那里获得关于他们当前 ASR 和 TTS 模型使用情况的意见。
-
语音助手使用 CPU 进行 ASR/TTS,将 GPU 释放给 LLM
一位用户成功实现了一个语音助手,该助手在 CPU 上运行语音识别和文本转语音模型,从而将 GPU 释放出来用于主要的 LLM。他们在 2022 年的 Macbook M2 和 AMD Ryzen 9 7900 上测试了 Qwen3-ASR 和 Kokoro-TTS ONNX 模型,发现 M2 基本可用,而 Ryzen 9 速度非常快。用户已分享代码供他人测试和探索此设置的可能性。
-
Hugging Face Transformers v5.13.0 增加了 KimiK、Xiaomi MiMo、NVIDIA 和 Qwen ASR 模型
Hugging Face 的 Transformers 库发布了 5.13.0 版本,引入了多个新的开源模型。此次更新包括 KimiK 的 Kimi K2.5,一个多模态代理模型,专为高级编码和自主执行而设计。此外,该版本还包含 Xiaomi MiMo 的 MiMo-V2-Flash,一个混合专家模型,针对长上下文推理和高效推理进行了优化。更新还整合了 NVIDIA 的 Nemotron 3.5 ASR 和 Nemotron ASR …
-
新研究推动了用于构音障碍语音和合成数据使用的ASR · 跟踪4个来源
研究人员正在探索改进自动语音识别(ASR)系统的新方法。一项研究详细介绍了如何使用个性化数据对Whisper模型进行微调,显著降低了构音障碍语音的词错误率,在使用大量数据的情况下达到了9.7%的错误率。另一篇论文研究了使用合成语音训练ASR系统,发现通过房间冲激响应增强合成音频可以弥合与真实世界数据的差距。此外,一个名为PreferenceASR的新测试集已被开发出来,用于根据ASR系统遵循用户指定输出偏好的能力进行评估,揭示了传统基…
-
audio.cpp 框架提供更快的音频模型推理速度
一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。
-
新紧凑型TTS模型Inflect-Micro-v2和Inflect-Nano-v2发布
Owen独立开发并资助了Inflect-Micro-v2和Inflect-Nano-v2,这是两个新的文本到波形语音合成模型。这些模型专为本地、固定语音的英语TTS设计,优先考虑参数少于1000万(Micro)的质量,或参数少于400万(Nano)的更小占用空间。在人类偏好研究和可懂度测试中,这两个模型都表现出具有竞争力的性能,同时还提供快速的CPU推理。
-
Google 的 Eloquent 听写应用因频繁转录错误而无法通过基准测试
一位用户在尝试对 Google 的新设备端听写应用 Eloquent 进行基准测试时,发现由于频繁的音频转录失败,该应用基本无法使用。尽管该应用在正常运行时准确率具有竞争力,但它经常返回不完整或根本没有转录内容,这让用户怀疑它表现得像一个聊天式 AI,有时会回应音频内容而不是转录它。用户还测试了 Google 的开源模型 Gemma 3n,该模型也出现了类似问题,这表明 Eloquent 可能隐藏了这些问题。
-
Whisfusion 使用掩码扩散模型实现更快、更准确的语音识别
研究人员开发了 Whisfusion,一种利用掩码扩散模型的新型非自回归自动语音识别(ASR)系统。该方法旨在匹配传统自回归模型的准确性,同时显著提高推理速度。Whisfusion 通过在冻结的 Whisper-large-v3 音频嵌入之上训练扩散解码器来实现这一点,从而实现并行解码,并在多种语言的速度和准确性方面优于现有模型。
-
FormalASR 将中文语音端到端转换为正式文本
研究人员开发了 FormalASR,一个新颖的端到端系统,旨在将中文语音直接转换为正式书面文本。这种方法绕过了 LLM 进行单独后编辑的需要,从而降低了延迟和计算成本。该系统利用了两个模型,参数量分别为 0.6B 和 1.7B,它们是从 Qwen3-ASR 微调而来,并在新创建的大规模数据集 WenetSpeech-Formal 和 Speechio-Formal 上进行了训练。
-
Omi Health 发布开放权重医疗 ASR 模型
Omi Health 创始人发布了 Omi Med STT v1,这是 NVIDIA 的 Parakeet TDT 0.6B 模型的一个微调版本,用于医疗自动语音识别 (ASR)。该开放权重模型旨在本地设备上运行,确保患者音频隐私。与其它模型相比,Omi Med STT v1 在医疗词错误率 (M-WER) 方面表现出竞争力,同时比大型模型更小、更快。
-
新方法利用仅解码器LLM增强同步语音翻译
研究人员正在开发新的同步语音翻译方法,重点关注仅解码器的大型语言模型。一种名为AlignAtt4LLM的方法,通过调整这些模型的注意力机制来提高德语和意大利语等语言的翻译质量,即使在低延迟场景下也是如此。另一种名为DOA的方法,在SpeechLLMs内部使用自注意力机制,在无需重新训练的情况下获得长文本翻译的对齐信号。此外,一个名为Canary的系统,拥有10亿参数,提供了多种语言的离线同步翻译能力。
-
OpenBrief 发布,成为本地优先的 AI 视频摘要器
OpenBrief 是一款新的开源、本地优先的桌面应用程序,旨在帮助用户处理视频和音频内容。它允许用户导入媒体、提取文字记录、生成摘要,甚至与内容进行聊天。该应用程序通过完全在用户计算机上运行来强调隐私,并支持文本转语音生成摘要和导出笔记等各种功能。
-
FormalASR系统将中文语音端到端转换为正式文本
研究人员开发了FormalASR,一个新颖的端到端系统,旨在将中文语音直接转换为正式书面文本。这种方法绕过了对单独的大型语言模型(LLM)进行后期编辑的需求,从而降低了设备上应用程序的延迟和计算成本。FormalASR利用经过微调的Qwen3-ASR模型(0.6B和1.7B参数),在新建的数据集WenetSpeech-Formal和Speechio-Formal上进行训练,显著降低了字符错误率并提高了文本质量指标。
-
科技企业家利用人工智能管理家庭数据迁移和智能设备
一位科技爱好者和企业家详细介绍了他将人工智能融入家庭的经历,首先是将他的数字生活迁移到新的MacBook Pro。他利用人工智能助手Claude Code,管理了数十年的数据、软件配置和开发环境的复杂迁移,这比传统的迁移工具要复杂得多。这位人工智能助手不仅简化了数据迁移,还识别并解决了硬件问题并优化了性能,这促使用户探索更广泛的人工智能在家居自动化中的应用。