Silero VAD
PulseAugur coverage of Silero VAD — every cluster mentioning Silero VAD across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
开发者通过 OCR 和音频门控修复 LLM 视频幻觉
一位开发者通过解决大型语言模型(LLM)误解音频和视频内容的问题,改进了其开源工具 crv。该工具现在使用带有 Whisper 的语音活动检测(VAD)门控,以防止纯音乐音频产生幻觉字幕。此外,crv 还集成了光学字符识别(OCR)来读取视频中烧录的字幕,并利用屏幕上的文本作为真实情况来纠正音频转录可能出现的误解,特别是对于名称、数字和特定术语。
-
audio.cpp 框架提供更快的音频模型推理速度
一个名为 audio.cpp 的新 C++ 推理框架已被开发出来,它构建在 ggml 之上,用于运行包括 TTS、ASR 和语音转换在内的各种音频模型。该框架旨在将多个音频模型整合到单个运行时中,从而无需为每个模型单独配置 Python 环境。初步基准测试显示速度有显著提升,部分 TTS 模型在热启动场景(模型被重复使用)下的运行速度比其 Python 版本快 5 倍。
-
本地 AI 模型离线语音循环完全在 CPU 上运行
一位开发者为本地 AI 模型创建了一个完全离线的语音交互循环,仅使用 CPU 资源,并确保所有数据都保留在用户机器上。该系统集成了 Silero VAD 用于语音活动检测,Parakeet STT 用于语音转文本,以及 Supertonic TTS 用于文本转语音,所有这些都通过 ONNX 运行。该设置旨在跨 macOS、Linux 和 Windows 平台兼容,并可与 Ollama 和 LM Studio 等本地 LLM 接口集成。
-
本地ASR路由器使用专用模型进行实时多语言转录
Gladia 的一位研究人员开发了一种新颖的实时多语言自动语音识别(ASR)方法,该方法可在本地硬件上运行。该系统不使用单一的大型模型,而是采用一个路由器,将音频路由到更小的、专门的单语模型。与现有系统和云 API 相比,这种方法在跨语种切换基准测试中实现了更低的词错误率,尽管在中途语言切换方面存在局限性。
-
新研究通过新方法应对多语言ASR挑战
研究人员正在探索多语言自动语音识别(ASR)的新方法,特别是在单次对话中使用多种语言的语码转换场景。一篇论文研究了通过模型合并将语码转换能力推广到未见过语言对的通用性,但成功有限。另一个项目BaltiVoice为巴尔蒂语引入了一个新的语音语料库和微调的Whisper模型,显著提高了ASR准确性。此外,一个名为WAXAL-NET的系统表明,专门的、较小的ASR模型在非洲语言方面可以优于大型多语言模型,并且一个实时多语言ASR系统使用小型…
-
Hugging Face 实现 Reachy Mini 的完全本地化对话
Hugging Face 发布了一份指南,详细介绍了如何为 Reachy Mini 机器人设置完全本地化的语音到语音对话流程。该设置采用级联方法,并推荐使用 llama.cpp 作为 LLM,Gemma 4、Silero VAD、Parakeet-TDT 进行语音转文本,以及 Qwen3-TTS 进行文本转语音。该系统优先考虑隐私,消除了 API 成本,并提供对流程的完全控制,允许用户在有新模型可用时进行组件替换。
-
WhisperPipe架构为实时应用大幅降低了ASR延迟和内存使用
研究人员开发了WhisperPipe,这是一种旨在提高实时自动语音识别(ASR)性能的新流式架构。该架构解决了像Whisper这样的大型Transformer模型在准确性和计算效率之间的权衡问题。WhisperPipe通过在语音活动检测、动态缓冲和自适应处理方面的创新,实现了有限的内存消耗和更低的延迟。