Mozilla DeepSpeech
PulseAugur coverage of Mozilla DeepSpeech — every cluster mentioning Mozilla DeepSpeech across labs, papers, and developer communities, ranked by signal.
-
Platypush 在树莓派上实现全本地语音助手设置
文章详细介绍了使用 Platypush 在树莓派等硬件上实现全本地语音助手的设置。它概述了一个包含本地热词检测(使用 assistant.openwakeword)、本地语音转文本(使用 assistant.vosk)和本地文本转语音(使用 tts.piperspeech)的流程。OpenAI API 可选用于语言模型任务,如意图识别或通用查询,如果配置了本地 OpenAI 兼容服务器,则整个系统可以在本地网络中运行。
-
本地语音助手设置完全在设备上运行
一种新的设置允许使用 Platypush 构建完全本地化的语音助手,主要为 Raspberry Pi 设备设计。该系统集成了 openwakeword(用于热词检测)、Vosk(用于本地语音转文本)和 Piper(用于文本转语音)等开源工具。虽然 OpenAI 的 API 可选用于高级语言处理,但核心组件可以完全在设备上或本地网络内运行,为基于云的助手提供了一个注重隐私的替代方案。
-
Reddit 上讨论的开源语音转文本模型
r/LocalLLaMA 子版块的用户正在讨论目前最好的开源语音转文本 (STT) 模型,重点关注实时性能和说话人分离能力。虽然 Whisper 模型得到了认可,但社区正在寻找 Whisper Flow 等工具的替代品。其他提到的 STT 解决方案包括 Vosk、Kaldi、Mozilla DeepSpeech、Coqui STT 和 NVIDIA 的产品,用户在询问可能提供改进的实时功能的新模型。
-
AssemblyAI列出语音应用的8种顶级开源STT模型
AssemblyAI发布了一份指南,详细介绍了用于构建语音应用的八种顶级开源语音转文本(STT)选项。分析强调,虽然这些模型提供了数据控制和定制化,但它们需要大量的开发工作才能投入生产。开发人员面临的关键挑战包括实现高准确性、低延迟以及处理真实音频条件,像Coqui STT和Mozilla DeepSpeech这样的项目在当前格局中已被Faster-Whisper和SpeechBrain取代。