Whisper
PulseAugur coverage of Whisper — every cluster mentioning Whisper across labs, papers, and developer communities, ranked by signal.
- developed by .openai 100%
- instance of speech recognition 90%
- used by claude-real-video 90%
- invested in Thinking machines 90%
- competes with Universal-3 Pro 90%
- used by CTranslate2 90%
- used by FFmpeg Micro 90%
- used by Assamese 90%
- competes with AssemblyAI 80%
- used by word error rate 80%
- used by whisper.cpp 80%
- used by speech recognition 70%
- 2026-08-27 research_milestone A study fine-tuned the Whisper model for automatic speech recognition in the Baniwa language, achieving notable error rate reductions. 来源
- 2026-06-09 research_milestone A study on fine-tuning OpenAI's Whisper for Swiss German ASR revealed improved performance and identified benchmark contamination issues. 来源
- 2026-05-12 research_milestone A new semi-supervised framework for speech confidence detection was proposed, achieving a Macro-F1 score of 0.751. 来源
15 天有情绪数据
-
新基准测试标准化强制对齐和自动语音识别评估
研究人员推出 FA-Bench,这是一个旨在标准化强制对齐和自动语音识别 (ASR) 系统评估的新开放框架。该基准测试通过统一跨各种模型的转录文本规范化、数据拆分和边界匹配协议,解决了先前比较中的不一致性。FA-Bench 包含 21 个开源模型和 9 个商业 API 的结果,在干净和嘈杂语音上进行了测试,重点关注单词和电话级别的准确时间戳估算。
-
Whisper模型从低频语音信号预测文本
研究人员开发了一种从低通滤波语音预测文本的新颖方法,这是该领域以前被忽视的任务。通过仅在最低的Mel bin(约450Hz截止频率)上微调Whisper模型,他们实现了36%的词错误率(WER)。研究发现,10%的语音片段被完美恢复,40%的WER为25%或更低,这表明低频语音特征与词汇内容之间存在很强的相关性。这一突破可能催生新的应用,例如利用韵律来指导大型语言模型的文本生成。
-
Itgan在NADI 2026上为鲁棒的阿拉伯语ASR适配Whisper
Itgan的研究人员详细介绍了他们在NADI 2026共享任务上的系统,重点关注鲁棒、混合方言和语码转换场景下的阿拉伯语自动语音识别(ASR)。他们的方法主要利用了Whisper,并通过LoRA等参数高效微调(PEFT)技术进行适应,并在消费级GPU上进行训练。该系统取得了有竞争力的结果,包括在突尼斯语码转换ASR上14.49%的词错误率和5.38%的字符错误率,通过模型平均和ROVER投票进一步提高了性能。
-
新研究探讨儿童语音识别自适应与成人性能保留问题
研究人员探索了自动语音识别(ASR)系统适应儿童语音的更好方法,同时保留对成人语音的识别性能。该研究比较了全微调(full fine-tuning)、LoRA和权重空间合并(weight-space merging)等技术在不同ASR架构(包括编码器-解码器、编码器-CTC和基于AudioLLM的系统)上的表现。实验重点关注阿拉伯语和英语儿童语音,结果表明,虽然自适应至关重要,但直接方法可能会降低成人语音识别的性能。权重空间合并技术通…
-
格罗宁根大学的免费AI转录工具Whisper用户数突破1000
格罗宁根大学的免费AI转录工具Whisper在教职员工和学生中的用户数已超过1000人。该工具于一年前推出,由UG数字能力中心开发,并托管在RUG的Habrok计算机集群上。Whisper通过将音频文件转换为文本,可显著节省时间。
-
通过提示工程和后处理,Whisper 听写准确性得到提升
作者详细介绍了他们如何提高 Whisper 语音转文本模型在个人听写中的准确性。他们发现许多看似的错误并非听错,而是填充词、口头更正或数字格式化的问题,这些可以通过简单的后处理步骤来解决。此外,使用句子形式的初始提示,而不是术语列表,显著提高了对 Kubernetes 和 PostgreSQL 等特定技术术语的识别能力。
-
AI 编码代理集成开发者工具,引发治理关注
MCP 生态系统正目睹开发者日益将 GitHub、OpenAI 和 Figma 等现有工具集成到他们的编码代理中,其速度超过了平台团队管理这些连接的能力。本周的数据显示了一个整合阶段,重点是管理已有的服务器,而不是添加新的服务器。GitHub Copilot、OpenAI 的模型、Figma 和 Anthropic 的 Claude 等关键集成备受关注,这凸显了需要强大的允许列表、访问控制和成本可见性来管理影子使用并确保安全。
-
离线AI应用HeliGO在手机上本地运行LLM
Ginigen开发了一款名为HeliGO的离线灾难和生存应用,旨在完全无需互联网连接即可运行。该应用使用基于Google Gemma-4 E4B的4位量化模型Edge-4B-TELL,该模型本地存储在设备上。针对移动设备的关键优化包括用于管理Android上核心分配的线程固定和用于减少模型加载时间的特性延迟加载。该应用还包含一个多阶段安全门,它分析模型的内部状态而不是其自我报告的置信度,从而解决了LLM幻觉的问题。
-
为尼日利亚语音模式微调Whisper
作者一直在微调OpenAI的Whisper模型,以更好地理解尼日利亚的语音模式。他们开发了一种方法来衡量模型在该特定方言上的性能,旨在提高其准确性和包容性。
-
用户寻求本地工具制作带旁白的解说视频
一位Reddit用户正在寻找免费的、本地运行的工具来生成带旁白的解说视频。他之前使用explainroo,该工具利用Kokoro进行配音,Whisper进行计时,无头Chrome进行视觉呈现,ffmpeg进行组装,但觉得其输出过于简单和重复。该用户愿意接受其他提供类似功能的工具、流程或个人设置的建议,且无需API密钥。
-
旧PC通过Whisper、Stable Diffusion和LLMs用于本地AI任务
一台配备Core i5-650处理器、8GB内存和RX 570显卡的旧电脑已被重新用于AI任务。用户成功集成了Whisper(一个开源语音转文本模型),利用whisper.cpp和Vulkan实现了实时转录速度。该设置现在支持三项本地AI工作负载,包括使用stable-diffusion.cpp进行图像生成和使用llama.cpp进行LLM,证明即使是配置不高、较旧的硬件,通过合适的软件也能执行有用的AI功能。
-
Python脚本简化使用OpenAI Whisper API进行音频转录
一位开发者创建了两个Python脚本,以利用OpenAI的Whisper API简化批量音频转录。第一个脚本约有130行代码,用于处理音频文件生成干净的文本记录,并提供语言检测和markdown格式化选项。第二个脚本更长,有262行代码,它利用FFmpeg进行音频解码,并结合OpenAI Whisper将音频转换为文本,旨在无需图形界面即可简化访谈或会议记录的转录。
-
AI 在 2 分钟内使用 Claude Code 和 FFmpeg 自动完成视频编辑
一个由 Claude Code 作为决策者、FFmpeg 进行处理的 AI 系统,将一段 62 秒的视频片段自动编辑成一个 40 秒的解释性视频。这个过程包括故意包含“嗯”和失焦镜头等错误,在没有人工干预编辑软件的情况下,两分钟内完成。该系统的决策过程以及任何转录错误,例如 Whisper 将“红眼”误解,也得到了记录。
-
Voice-to-SQL 系统使用大语言模型和浏览器 API 进行安全的数据库查询
一位开发者创建了一个 Voice-to-SQL 系统,允许用户通过自然语言(口语或书面语)查询数据库。该系统利用浏览器内的 Web Speech API 进行语音转录,以最大限度地减少延迟和成本。其关键组成部分是利用 Groq 上的 Qwen3.8 27B 模型进行文本到 SQL 的转换,并将数据库模式作为上下文提供给提示,以确保准确的查询生成。至关重要的是,该系统包含一个强大的清理层,以防止恶意 SQL 注入,只允许 SELECT …
-
Cactus Compute 发布 Whistle,一款紧凑型设备端语音转文本模型
Cactus Compute 发布了 Whistle,这是一款专为在手机、可穿戴设备和微控制器等各种平台上高效运行而设计的全新设备端语音转文本模型。该模型文件大小仅为 16.9 MB,运行在与其前身 Needle 模型相同的 CPU 引擎上,无需外部依赖或 GPU。Whistle 支持七种语言的转录、带概率的词级时间戳以及用于匹配和检索的语音嵌入,并提供关键词偏置选项以提高特定术语的准确性。
-
CTranslate2推理引擎易受代码执行和内存泄露攻击
在CTranslate2中发现了两个关键漏洞,CVE-2026-102566和CVE-2026-102567。CTranslate2是Whisper和OpenNMT使用的推理引擎。这些与模型加载器相关的缺陷在加载恶意模型文件时可能导致任意代码执行或内存泄露/崩溃。这些漏洞影响4.8.1之前的所有版本,建议用户更新到已修复的版本。
-
基于LLM的过滤可改善嘈杂警用音频的ASR性能
研究人员开发了一种新方法,通过使用伪标签来改进嘈杂警用音频的自动语音识别(ASR)系统。该技术将Whisper和Qwen3-ASR等基础ASR模型适配到特定领域,例如巴尔的摩和芝加哥的警务通信。研究发现,现有的置信度指标不足以过滤伪标签,因此引入了LLM-as-a-judge过滤范式,显著降低了词错误率(WER)。此外,还探索了跨模型伪标签方法作为未来研究的有前景的方向。
-
T-SANDHI 通过解耦音调变化改进台语语音识别
研究人员开发了 T-SANDHI,这是一种改进低资源语言(如台语)自动语音识别 (ASR) 的新方法。与先前认为声调变化是主要挑战的假设不同,这项工作将声调变化与词语本调之间的混淆确定为主要的性能瓶颈。T-SANDHI 在冻结的 Whisper 模型基础上,通过具有动态门控的混合注入模块显式地将声学信号与词汇意图解耦,在 TAT-MOE 语料库上展示了准确性和参数效率的显著提高。
-
Whisper模型已适配用于警用执法记录仪音频转录
研究人员开发了一种方法,将OpenAI的Whisper模型适配用于转录执法记录仪的音频。这种适配利用了低秩适配(LoRA)技术,以提高在嘈杂声学环境(如警报器或无线电干扰)下的准确性。适配后的模型可以在消费级硬件上运行,并已集成到一个将转录内容转换为证据关联事件图的系统中,实现了高词汇映射率。
-
开源工具支持私有、自托管语音AI助手
一位名叫Ravi Roy的工程师强调了构建私有、开源语音AI助手的日益增长的趋势,摆脱了专有的云服务。通过集成开源自动语音识别(ASR)、大型语言模型(LLM)和文本转语音(TTS)组件,这种方法提供了增强的数据隐私、降低的成本和更大的控制权。像OpenAI Whisper这样的模型在ASR方面因其准确性而受到关注,使开发人员能够创建定制的、本地优先的对话代理。