speech recognition
PulseAugur coverage of speech recognition — every cluster mentioning speech recognition across labs, papers, and developer communities, ranked by signal.
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- instance of CatalyzeX 70%
- instance of ScienceCast 70%
- used by word error rate 70%
- used by alphaXiv 70%
- used by LibriSpeech 70%
- used by whisper tiny 70%
- used by Vad 70%
- used by Gotit.pub 60%
- instance of word error rate 60%
- competes with speech synthesis 50%
16 天有情绪数据
-
Mozilla Data Collective 启动 2 万美元 ASR 竞赛,专注于语码转换
Mozilla Data Collective 正在举办一场模型竞赛,奖金池为 20,000 美元,专注于自动语音识别 (ASR)。该竞赛特别针对语码转换的挑战,即说话者在一次话语中使用多种语言或方言。参赛者需要开发能够准确转录三种语言对之间语码转换语音的 ASR 系统:北美西班牙语和英语、印度尼西亚语和爪哇语,以及西班牙语和纳瓦特尔语,旨在推动这些服务不足的语言社区的最新技术水平。
-
思维链提示在翻译系统中显示出有限的语音感知能力
一篇新发表在arXiv上的研究论文探讨了思维链(CoT)提示在语音到文本翻译(S2TT)系统中的有效性。研究发现,当与级联的自动语音识别(ASR)和文本到文本翻译(T2TT)模块一起使用时,CoT主要依赖转录的文本,并且很少利用实际的语音线索。研究人员建议需要进行架构更改,以更好地整合声学信息,从而提高S2TT的性能。
-
新研究解决ASR效率和基准测试作弊问题 · 已追踪4个来源
两篇新研究论文解决了自动语音识别(ASR)系统中的挑战。第一篇“TurboBias 2.0”提出了一种用于换能器(transducer)ASR短语增强的生产高效框架,能够以低延迟和高吞吐量实现多用户的个性化上下文偏置。第二篇论文“Towards Quantifying Benchmark Optimization in ASR Models”提出了一种方法来识别和量化ASR模型可能过度优化公共基准测试的情况,从而可能在不提高实际性能的…
-
LLM ASR 连接器共享策略提升多语言性能
研究人员为基于LLM的自动语音识别(ASR)系统开发了一种新颖的连接器共享策略,该策略利用了语言家族成员关系。这种方法允许单个连接器服务于同一家族内的多种语言,与为每种语言训练单独的连接器相比,减少了参数数量。该方法已在两个多语言LLM和真实语料库上得到验证,展示了改进的泛化能力,并为部署多语言ASR提供了更实用、更具可扩展性的解决方案。
-
AssemblyAI 指导使用 STT-LLM-TTS 架构构建实时语音代理
AssemblyAI 正在详细介绍如何使用连接语音识别 (STT)、大型语言模型 (LLM) 和文本转语音 (TTS) 组件的链式架构来构建实时语音代理。该公司强调低延迟流式管道的重要性,并就集成其 Universal 3.5 Pro Realtime STT 模型提供了具体指导。文章还探讨了 Vapi、Pipecat 和 LiveKit 等不同的编排平台,并讨论了从 Retell 和 Super 等公司吸取的关于生产级语音代理需求的…
-
AssemblyAI 表示,定制语音识别模型很少能超越通用人工智能
AssemblyAI 认为,定制语音识别模型通常是不必要的,甚至可能不如现代通用模型准确。虽然定制模型曾经是提高专业领域准确性的标准,但目前在海量、多样化数据集上训练的 AI 模型开箱即用,具有高度的鲁棒性和准确性。该公司建议,通常可以在不需要完整定制模型的情况下满足定制词汇需求,但对于儿童语音等高度独特的音频特征,也存在例外情况。
-
新的Fair-ASR协议重新评估LLM越狱,引入高效ReCode攻击
研究人员推出了一种名为Fair-ASR的新协议,用于评估GPT-5等大型语言模型的越狱攻击。该方法通过使用共享的目标调用预算来标准化比较,解决了先前依赖FLOPs或忽略预算限制的评估方法的局限性。研究发现,传统的攻击方法仍然具有竞争力,并引入了一种新颖、预算高效的ReCode攻击,该攻击在GPT-5上取得了85%的成功率,且攻击者调用次数显著减少。
-
新的TriageSim框架从EHR数据生成合成的急诊分诊对话
研究人员开发了TriageSim,一个旨在为急诊分诊场景生成逼真对话模拟的框架。该系统利用结构化电子健康记录创建个性化对话,并附带合成的文本和音频。生成的语料库包含约800个合成对话,已对其语言、行为和声学保真度进行了评估,其中一部分也评估了医学准确性。该框架的实用性通过其在对话式分诊分类中的应用得到证明,在不同模式下显示出适度的同意度。
-
LangChain 通过流式架构实现实时语音助手开发
构建一个可投入生产的语音助手不仅仅是将语音识别连接到大型语言模型,然后再连接到语音合成。一个实用的架构将音频传输、语音识别、助手推理、工具执行和语音合成等职责分开,允许每个组件独立替换。流式处理对于自然的对话感觉至关重要,其中语音转文本和助手响应生成等阶段在数据可用时立即开始,而不是等待整个句子或响应。
-
AssemblyAI:语音助手成功取决于STT准确性,而非花哨功能
AssemblyAI认为,语音助手成功的最关键因素是其语音转文本(STT)基础的准确性,而不是速度或仪表板美观等表面指标。该公司强调,初始STT阶段的错误会被下游组件(如LLM)继承,导致自信的错误回答和糟糕的用户体验。AssemblyAI建议根据实际音频准确性、轮次检测、中断处理、延迟、计费模式、可扩展性和开发者体验来评估语音助手API,其中准确性是最关键的要素。
-
新的拒绝服务攻击通过声学扰动目标端到端语音大语言模型
研究人员开发了一种专门针对端到端(E2E)语音大语言模型(LLM)的新型拒绝服务(DoS)攻击。与以往依赖文本提示操纵的攻击不同,该方法向语音输入引入了不易察觉的声学扰动。这些扰动经过优化,旨在破坏模型的自回归生成过程,导致输出延长并增加计算资源消耗,同时不会显著改变原始语音的语义内容。
-
VoxZip框架将音频大模型键值缓存需求降低20倍
研究人员开发了VoxZip,一个新颖的两阶段框架,旨在压缩语音大模型中长上下文音频推理的键值缓存。该方法使用自动语音识别(ASR)转录作为语义锚点来对齐和压缩音频令牌,然后采用动态过滤策略移除非必需令牌。在Qwen3-Omni上的评估表明,VoxZip可以在长上下文场景下实现20倍的键值缓存压缩,同时保持超过90%的未压缩基线性能;在4倍压缩下,它可将推理吞吐量提高1.9倍,并将内存开销降低3.3倍。
-
本地 AI 更新:llama.cpp、PyTorch、Kimi-K3 和 NVIDIA NeMo Speech 3.0
本地 AI 和开源模型领域的最新更新包括 llama.cpp 通过 CUDA Fusion 实现的性能增强,解决了 PyTorch 中针对 AMD GPU 的关键量化错误,以及备受关注的 Moonshot AI Kimi-K3 模型,该模型利用压缩张量实现高效推理。此外,NVIDIA 发布了 NeMo Speech 3.0,专注于核心语音 AI 任务,LiquidAI 的 LFM2.5-2.6B 模型在本地代理部署方面也日益受到欢迎。
-
开发者使用 nemotron 3.5 ASR 为 Pi 创建本地语音输入扩展
一位开发者为 Pi 编码终端创建了一个轻量级的本地语音输入扩展,利用 NVIDIA 的 nemotron 3.5 0.6B 自动语音识别模型。该扩展旨在实现简单性,直接在设备上运行 STT 服务器,无需单独的服务器。它下载大约 700MB 的模型,并允许用户将语音输入到终端,可以选择接受或丢弃转录。
-
新框架旨在实现自动化语音识别系统的去殖民化
本文提出了一个开发更具文化适应性的自动化语音识别(ASR)系统的框架。文章认为,当前ASR系统在低资源和土著语言方面存在的缺陷不仅仅是技术问题,也反映了殖民主义的语言政策。作者们提出了一个“三种伤害”(误认、错位、不信任)的分类法和一个七层语言多样性模型。他们主张采用参与式设计方法,让受影响的社区成为ASR技术开发和治理的有机组成部分。
-
新研究对比上下文偏置和语音大语言模型在自动语音识别中识别生词的能力
一篇新发表在arXiv上的研究论文探讨了提高自动语音识别(ASR)系统识别新词和生词能力的方法。该研究将上下文偏置技术(在推理过程中提供词汇表)与使用直接上下文提示的语音大语言模型(LLMs)进行了比较。结果表明,上下文偏置方法显著降低了偏置词的词错误率,同时对其他词的影响最小;而语音大语言模型在朗读语音方面表现良好,但在非朗读语音上的泛化能力较差,并且对提示的变化敏感。
-
收集高质量语音和视频数据集的挑战
为多模态AI收集高质量数据集,特别是工作室级别的语音和自我中心视频,面临着重大挑战。这些挑战包括保持一致的录制环境、管理设备和麦克风的差异性、确保标注质量和标注者之间的一致性,以及解决参与者的隐私问题。在不牺牲质量的情况下扩大数据收集规模仍然是一个关键瓶颈,一些质量问题直到模型训练时才显现出来。
-
新的蒸馏方法增强了多语言语音识别系统
研究人员开发了一种名为语言专业化多教师在线策略蒸馏(LS-MOPD)的新方法,以改进多语言自动语音识别(ASR)系统。该方法解决了在具有不同特征的语言上训练单一模型时出现的优化冲突。LS-MOPD使用强化学习为每种语言训练专门的“教师”模型,然后将它们的知识蒸馏到一个通才的“学生”模型中,从而增强了语言层面的专业化和整体性能。
-
研究探测失语症语音对自动语音识别模型的影响
研究人员使用普通话失语症语音对Transformer自动语音识别(ASR)模型进行了分层探测分析。研究发现,对于失语症语音,所有层级的音素边界信息仍然较弱,而在上层中音素识别度更高。识别难度编码在最深层,词汇声调是一个持续的挑战。研究结果表明,失语症语音比低级声学特征对高级表示的影响更大,这为参数高效微调方法的开发提供了指导。
-
Speech2Grasp框架使人形机器人能够通过语音指令抓取物体
研究人员开发了Speech2Grasp,一个新颖的框架,使人形机器人能够理解并执行通过语音指令抓取物体的命令。该方法有效地将现有文本条件模型的性能迁移到语音输入,利用了一个轻量级的基于MLP的投影仪。实验表明,Speech2Grasp在准确性和推理速度方面均优于传统的自动语音识别(ASR)管道,为将基于文本的人工智能系统扩展到处理自然语音提供了一种实用的方法。