speech recognition
PulseAugur coverage of speech recognition — every cluster mentioning speech recognition across labs, papers, and developer communities, ranked by signal.
17 天有情绪数据
-
基于音素引导初始化的LLM增强语音识别 · 跟踪2个来源
研究人员开发了一种新颖的音素引导初始化方法,以提高大型语言模型(LLM)在自动语音识别(ASR)中的性能,尤其是在低资源场景下。该方法在端到端微调之前,先在语音到音素(S2P)任务上预训练音频编码器,在音素到字形(P2G)任务上预训练LLM。在日本、中文、鞑靼语和乌尔都语等多种语言的实验表明,该方法可以媲美或超越现有的级联和端到端ASR模型。此外,在多语言LLM驱动的ASR P2G方面也取得了进展,重点在于处理S2P不确定性和数据不平…
-
新框架TransferBreaker应对语音识别模型的对抗性攻击
研究人员开发了一个名为TransferBreaker的新框架,以增强微调自动语音识别(ASR)模型的安全性。这些模型通常在黑盒环境中部署,容易受到对抗性攻击,即为基础模型设计的扰动会显著降低微调版本的性能。TransferBreaker集成了多种技术,包括基础对抗性微调和潜在雅可比正则化,以抑制这种对抗性可迁移性。在多种语言和ASR模型上的评估表明,在对抗性条件下,词错误率得到了显著降低。
-
Itgan在NADI 2026上为鲁棒的阿拉伯语ASR适配Whisper
Itgan的研究人员详细介绍了他们在NADI 2026共享任务上的系统,重点关注鲁棒、混合方言和语码转换场景下的阿拉伯语自动语音识别(ASR)。他们的方法主要利用了Whisper,并通过LoRA等参数高效微调(PEFT)技术进行适应,并在消费级GPU上进行训练。该系统取得了有竞争力的结果,包括在突尼斯语码转换ASR上14.49%的词错误率和5.38%的字符错误率,通过模型平均和ROVER投票进一步提高了性能。
-
新方法InterCorrect提升了语音识别对不同群体的公平性
研究人员开发了一种名为InterCorrect的新方法,以提高自动语音识别(ASR)系统的公平性,特别是对于属于多个群体的人群。该方法涉及合并特定于人口统计学的适配模型,然后将特定于交叉点的校正向量应用于全局合并模型。实验表明,该技术显著降低了总体词错误率(WER),并提高了跨各种人口统计学轴的性能,尽管它并不总是能保证减少亚组差异。
-
AI 代码审查工具 LiveReview 正在开发中,讨论后端概念
一位开发者正在构建 LiveReview,这是一个 AI 驱动的代码审查工具,旨在实现爆炸半径感知。该工具旨在帮助开发者理解代码更改的潜在影响。开发者还分享了关于后端开发概念的见解,例如端口号和为语音识别实现重试策略。
-
AI语音助手难以识别英式口音,新基准揭示问题
一个新的基准CavaBench已被开发出来,用于评估AI语音助手对各种英式口音的鲁棒性。目前,通常以美式英语为训练对象的系统,在面对苏格兰、爱尔兰和威尔士口音时,会出现显著的词错误率(WER),导致工具调用参数损坏和响应不正确,尤其是在金融应用中。该基准表明,虽然WER与下游任务性能密切相关,但与口音相关的失败在不同模型和条件下可能差异很大,这凸显了设计更具包容性的语音助手的必要性。
-
新框架增强LLM处理和理解语音的能力
两篇新的研究论文提出了一种将语音处理与大型语言模型(LLM)集成的新颖框架。DirectSpeech2LLM旨在通过在冻结的LLM嵌入上使用CTC损失来缓解语音-LLM中的提示过拟合,从而实现对语音翻译等未见任务的泛化。DuplexJev提供了一种通过将ASR编码器状态馈送到冻结的LLM来实现实时、批量语音决策的方法,使其能够‘听到’超越文本记录的内容,并在口语问答和情感识别等任务中取得高精度。
-
本地 AI 语音转文本技巧侧重于麦克风质量
一位 Mastodon 用户分享了提高本地语音转文本 (STT) 模型性能的技巧,强调检查麦克风设置的重要性。他们指出,音频输入质量问题,例如音量低或设备选择不正确,即使是先进的 AI 模型,也可能导致转录结果不佳。
-
Suno AI为其音乐平台增加了口语生成功能
AI音乐生成器Suno推出了新的“Speech”功能,允许用户创建带有伴随背景音乐的口语音频。此扩展功能超越了音乐生成,涵盖了诗歌、冥想和戏剧性画外音等口语内容。该功能目前处于公开测试阶段,提供简单的基于提示的生成以及用于自定义脚本和语音调整的高级选项,尽管Suno承认该功能仍处于早期开发阶段。
-
Apple 研究揭示扩散模型中的置信度局限性
Apple 机器学习研究发布了一篇论文,详细介绍了扩散模型中置信度的局限性,尤其是在 token 依赖性方面。研究强调,当前方法通常未能考虑到 token 之间固有的依赖性,从而导致不准确。该论文还探讨了 on-policy distillation 在训练推理模型方面的有效性和缺点,并研究了位置预测作为 transformer 的预训练策略。
-
新数据集WASIL增强了阿拉伯语大型语言模型口语交互能力
研究人员推出了WASIL,一个旨在改善阿拉伯语口语与大型语言模型(LLMs)交互的新数据集。该数据集包含超过8,500轮真实场景下的口语交互,附带音频、自动语音识别(ASR)假设、助手响应和用户反馈,其中14.2%的交互被标记为不满意。WASIL还包含一个2,000轮的测试集,涵盖现代标准阿拉伯语和四种主要方言,并附有可回答性标注,以区分ASR错误和真正的无法回答。该资源旨在通过区分语音识别问题和模型固有的能力,来促进对LLM语音助手的更好评估。
-
AssemblyAI 将 Ambient AI 记录仪从医疗领域扩展到兽医和法律领域
AssemblyAI 正在探索将其 Ambient AI 记录仪技术应用于医疗领域之外的领域,特别是兽医和法律实践。核心技术涉及被动捕获专业对话并将其转化为结构化文档。虽然捕获、说话人归属和结构化提取的基本架构保持一致,但不同垂直领域需要进行重大调整。对于兽医实践,一个关键挑战是没有会说话的病人,这需要 AI 来区分主人观察、主人结论和兽医的发现。
-
2026年联络中心AI将从呼叫转接转向问题解决
联络中心AI正迅速从试点项目发展到全面投入生产,重点也从呼叫转接显著转向实际问题解决。2026年将更加强调实时AI能力,例如在实时通话中提供信息和标记合规性问题。买家越来越关注底层的语音模型,而不仅仅是CCaaS平台,寻求透明度和更换组件的能力。
-
新的EAVA方法增强了语音大语言模型在ASR领域的适应性
研究人员开发了一种名为“通过适配器唤醒编码器”(EAVA)的新方法,以改进语音大语言模型(Speech-LLMs)在自动语音识别(ASR)领域的领域自适应微调。该方法通过在语音编码器的每一层训练轻量级适配器,在保留预训练信息的同时融入目标领域声学知识。随后,使用低秩适配器(LoRA)对整个模型在LLM上进行联合微调。实验表明,EAVA在包括儿童和方言语音在内的领域偏移数据集上超越了现有方法,确立了新的最先进性能。
-
新的语音识别方法提高了准确性和延迟
研究人员开发了一种新的流式自动语音识别(ASR)方法,该方法提高了转录准确性和延迟。该方法称为AWED,使用词级发射延迟指标和新颖的奖励函数来联合优化转录质量和速度。在测试中,AWED训练的模型在各种前瞻预算下显著优于其基线,降低了词错误率和感知延迟。
-
新基准RoleBreak测试口语对话系统中的长时程角色扮演能力
研究人员推出了RoleBreak,一个旨在评估口语对话系统长时程角色扮演能力的新基准。该基准包含超过300个角色和数千个人工验证的对话轮次,并设有评估角色一致性、交互质量、安全性和语音情感在长时间对话中的特定标准。对九种系统配置的评估显示,尽管当前模型在保持语义角色方面优于语音情感,但在长期一致性方面存在困难,平均在约11轮后就会在角色和安全方面出现失败。语言模型规模的扩大显著提高了语义鲁棒性,但对语音表现力的影响甚微,这表明口语角色…
-
开源工具支持私有、自托管语音AI助手
一位名叫Ravi Roy的工程师强调了构建私有、开源语音AI助手的日益增长的趋势,摆脱了专有的云服务。通过集成开源自动语音识别(ASR)、大型语言模型(LLM)和文本转语音(TTS)组件,这种方法提供了增强的数据隐私、降低的成本和更大的控制权。像OpenAI Whisper这样的模型在ASR方面因其准确性而受到关注,使开发人员能够创建定制的、本地优先的对话代理。
-
新的DUPAR框架提高了语音助手的检索速度和准确性
研究人员开发了DUPAR,一个新颖的对话检索框架,旨在提高语音助手的速度和准确性。该系统采用双路径方法:一条快速路径使用适配的音频编码器搜索跨轮证据缓存,另一条较慢的路径在缓存置信度低时执行全索引检索。该框架旨在减少延迟并减轻传统自动语音识别(ASR)系统引入的错误。
-
机器遗忘技术降低了音频语言模型的隐私风险
研究人员开发并评估了几种用于语音问答大型音频语言模型(LALMs)的机器遗忘策略。这些方法包括梯度上升、任务算术和基于对齐的微调,旨在从LALMs中移除敏感信息,同时保留其核心语音理解和问答能力。实验表明,这些遗忘技术可以将隐私泄露显著降低高达80%,同时对非私有语音问答和通用语音理解任务的性能影响极小。
-
大型语言模型融合可提升自动语音识别性能且无额外计算成本
研究人员开发了一种新颖的方法,可以将大型语言模型(LLMs)集成到自动语音识别(ASR)系统中,而不会增加计算成本。该方法利用LoRA(低秩适配)技术将LLMs直接融合到ASR模型的参数中。在CSJ和LibriSpeech数据集上的实验表明,这种语言模型融合在领域适应方面一致地提高了ASR性能,且不影响推理速度或内存使用。