Qwen3 ASR
PulseAugur coverage of Qwen3 ASR — every cluster mentioning Qwen3 ASR across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
r/LocalLLaMA 用户寻求 ASR 和 TTS 模型推荐
r/LocalLLaMA 上的这篇 Reddit 帖子在征求自动语音识别 (ASR) 和文本转语音 (TTS) 模型推荐。原帖作者目前正在使用 Whisper 和 Kokoro 等旧模型配合 koboldcpp,并正在寻找更新、可能更好的替代品。他们提到了 Qwen3-ASR 和 Qwen3-TTS,但尚未测试过,并希望从社区那里获得关于他们当前 ASR 和 TTS 模型使用情况的意见。
-
语音助手使用 CPU 进行 ASR/TTS,将 GPU 释放给 LLM
一位用户成功实现了一个语音助手,该助手在 CPU 上运行语音识别和文本转语音模型,从而将 GPU 释放出来用于主要的 LLM。他们在 2022 年的 Macbook M2 和 AMD Ryzen 9 7900 上测试了 Qwen3-ASR 和 Kokoro-TTS ONNX 模型,发现 M2 基本可用,而 Ryzen 9 速度非常快。用户已分享代码供他人测试和探索此设置的可能性。
-
Hugging Face Transformers v5.13.0 增加了 KimiK、Xiaomi MiMo、NVIDIA 和 Qwen ASR 模型
Hugging Face 的 Transformers 库发布了 5.13.0 版本,引入了多个新的开源模型。此次更新包括 KimiK 的 Kimi K2.5,一个多模态代理模型,专为高级编码和自主执行而设计。此外,该版本还包含 Xiaomi MiMo 的 MiMo-V2-Flash,一个混合专家模型,针对长上下文推理和高效推理进行了优化。更新还整合了 NVIDIA 的 Nemotron 3.5 ASR 和 Nemotron ASR …
-
新研究推动了用于构音障碍语音和合成数据使用的ASR · 跟踪4个来源
研究人员正在探索改进自动语音识别(ASR)系统的新方法。一项研究详细介绍了如何使用个性化数据对Whisper模型进行微调,显著降低了构音障碍语音的词错误率,在使用大量数据的情况下达到了9.7%的错误率。另一篇论文研究了使用合成语音训练ASR系统,发现通过房间冲激响应增强合成音频可以弥合与真实世界数据的差距。此外,一个名为PreferenceASR的新测试集已被开发出来,用于根据ASR系统遵循用户指定输出偏好的能力进行评估,揭示了传统基…
-
audio.cpp 框架提供更快的音频模型推理速度
一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。
-
Google 的 Eloquent 听写应用因频繁转录错误而无法通过基准测试
一位用户在尝试对 Google 的新设备端听写应用 Eloquent 进行基准测试时,发现由于频繁的音频转录失败,该应用基本无法使用。尽管该应用在正常运行时准确率具有竞争力,但它经常返回不完整或根本没有转录内容,这让用户怀疑它表现得像一个聊天式 AI,有时会回应音频内容而不是转录它。用户还测试了 Google 的开源模型 Gemma 3n,该模型也出现了类似问题,这表明 Eloquent 可能隐藏了这些问题。
-
Whisfusion 使用掩码扩散模型实现更快、更准确的语音识别
研究人员开发了 Whisfusion,一种利用掩码扩散模型的新型非自回归自动语音识别(ASR)系统。该方法旨在匹配传统自回归模型的准确性,同时显著提高推理速度。Whisfusion 通过在冻结的 Whisper-large-v3 音频嵌入之上训练扩散解码器来实现这一点,从而实现并行解码,并在多种语言的速度和准确性方面优于现有模型。
-
FormalASR 将中文语音端到端转换为正式文本
研究人员开发了 FormalASR,一个新颖的端到端系统,旨在将中文语音直接转换为正式书面文本。这种方法绕过了 LLM 进行单独后编辑的需要,从而降低了延迟和计算成本。该系统利用了两个模型,参数量分别为 0.6B 和 1.7B,它们是从 Qwen3-ASR 微调而来,并在新创建的大规模数据集 WenetSpeech-Formal 和 Speechio-Formal 上进行了训练。
-
Omi Health 发布开放权重医疗 ASR 模型
Omi Health 创始人发布了 Omi Med STT v1,这是 NVIDIA 的 Parakeet TDT 0.6B 模型的一个微调版本,用于医疗自动语音识别 (ASR)。该开放权重模型旨在本地设备上运行,确保患者音频隐私。与其它模型相比,Omi Med STT v1 在医疗词错误率 (M-WER) 方面表现出竞争力,同时比大型模型更小、更快。
-
新方法利用仅解码器LLM增强同步语音翻译
研究人员正在开发新的同步语音翻译方法,重点关注仅解码器的大型语言模型。一种名为AlignAtt4LLM的方法,通过调整这些模型的注意力机制来提高德语和意大利语等语言的翻译质量,即使在低延迟场景下也是如此。另一种名为DOA的方法,在SpeechLLMs内部使用自注意力机制,在无需重新训练的情况下获得长文本翻译的对齐信号。此外,一个名为Canary的系统,拥有10亿参数,提供了多种语言的离线同步翻译能力。
-
OpenBrief 发布,成为本地优先的 AI 视频摘要器
OpenBrief 是一款新的开源、本地优先的桌面应用程序,旨在帮助用户处理视频和音频内容。它允许用户导入媒体、提取文字记录、生成摘要,甚至与内容进行聊天。该应用程序通过完全在用户计算机上运行来强调隐私,并支持文本转语音生成摘要和导出笔记等各种功能。
-
FormalASR系统将中文语音端到端转换为正式文本
研究人员开发了FormalASR,一个新颖的端到端系统,旨在将中文语音直接转换为正式书面文本。这种方法绕过了对单独的大型语言模型(LLM)进行后期编辑的需求,从而降低了设备上应用程序的延迟和计算成本。FormalASR利用经过微调的Qwen3-ASR模型(0.6B和1.7B参数),在新建的数据集WenetSpeech-Formal和Speechio-Formal上进行训练,显著降低了字符错误率并提高了文本质量指标。
-
科技企业家利用人工智能管理家庭数据迁移和智能设备
一位科技爱好者和企业家详细介绍了他将人工智能融入家庭的经历,首先是将他的数字生活迁移到新的MacBook Pro。他利用人工智能助手Claude Code,管理了数十年的数据、软件配置和开发环境的复杂迁移,这比传统的迁移工具要复杂得多。这位人工智能助手不仅简化了数据迁移,还识别并解决了硬件问题并优化了性能,这促使用户探索更广泛的人工智能在家居自动化中的应用。
-
新的FADE方法改进了面向边缘设备的ASR模型量化
研究人员开发了FADE,一种用于改进编码器-解码器自动语音识别(ASR)模型后训练量化的新颖框架。该方法通过为每个层分配自适应补偿系数来解决跨层误差累积的问题。FADE结合了来自权重几何的内在脆弱性分数和数据驱动的校准可靠性分数,以平衡局部保真度和跨层误差校正。在Whisper和Qwen3-ASR等模型上的实验证明,在3位和4位精度下,词错误率得到了一致的改进。