word error rate
PulseAugur coverage of word error rate — every cluster mentioning word error rate across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Whisper ASR工具助力新西兰粤语口述历史转录
一篇新论文探讨了自动语音识别(ASR)工具(特别是Whisper)在多语种口述历史研究中的应用。该研究聚焦于新西兰的粤语复兴工作,发现虽然Whisper显著缩短了转录时间,但其非英语部分的词错误率(WER)可能高达12.10%。尽管如此,该工具在提供初步转录方面仍被认为很有价值。
-
新指标OVMI标准化语音BCI评估
研究人员引入了一种名为开放词汇互信息(OVMI)的新指标,以标准化语音脑机接口(BCI)的评估。该指标通过提供一个通用的通信尺度,解决了比较使用不同数据集、记录方法和词汇表的BCI所面临的挑战。OVMI衡量BCI系统相对于用户意图语音分布所传达的信息量,比准确率或词错误率等可能夸大系统能力的传统指标提供了更准确的评估。研究人员证明,使用OVMI可以显著提高准确性,并促进语音BCI更好的词汇设计。
-
新的批处理方法提高了语音转录的准确性和速度
一篇新论文介绍了一种名为“上下文感知交错批处理”(Context-Aware Interleaved Batching)的方法,旨在提高语音转录的准确性和效率。该技术通过在批处理的音频片段中维护历史上下文,解决了现有系统(如WhisperX)的局限性,从而降低了词错误率,并能更好地转录专有名词。所提出的方法旨在将批处理的高吞吐量推理速度与顺序处理中通常存在的上下文连贯性结合起来。
-
新的VoiceCodeBench基准评估ASR在结构化令牌上的准确性
引入了一个名为VoiceCodeBench的新基准,用于评估自动语音识别(ASR)系统在恢复特定结构化令牌(如标识符和测量量)方面的准确性。传统的词错误率(WER)等指标未能完全捕捉ASR在这些关键应用中的性能。VoiceCodeBench包含300个录制的职场片段,并与WER一起评估系统的规范令牌/实体匹配(CTEM)和任务成功率(TSR)。目前领先的ASR系统仅达到68.7%的任务成功率,表明迫切需要实体敏感的评估指标。
-
Hugging Face 将全球南方语言加入开放语音识别排行榜
Hugging Face 通过引入两个新的评估集 Monsoon en-IN 和 Monsoon hi-IN,扩展了其开放语音识别(ASR)排行榜,以更好地代表全球南方语言。这些新增内容旨在解决自动语音识别(ASR)系统在某些人群中表现不佳的已知问题,而传统词错误率(WER)指标无法捕捉到这一点。新数据集旨在跨越地理、年龄、性别、设备和声学环境等多个维度进行变化,从而提供对 ASR 模型更全面的评估。
-
使用 Whisper 和 SraVaani 模型微调的新米佐语 ASR 系统
研究人员通过收集和整理超过 17 小时的语音数据,为资源匮乏的米佐语开发了一个新的自动语音识别 (ASR) 系统。他们微调了三个 Whisper 多语言模型和 SraVaani 1.0 印度多语言模型。Whisper-large-v3 模型在常规评估中实现了 18.08% 的最低词错误率 (WER),在形态感知评估中为 7.22%。虽然 SraVaani 1.0 的初始 WER 较高,但微调显著提高了其性能,证明了适应性模型对未见语言的有效性。
-
AssemblyAI 提出漏检实体率以提高语音转文本准确性
AssemblyAI 认为,语音转文本系统的传统词错误率 (WER) 指标不足,因为它们未能考虑到姓名、数字和医学术语等特定实体的 Yet. 该公司提出了一个新的指标,漏检实体率 (MER),该指标侧重于这些关键实体的准确性。AssemblyAI 强调,尽管低 WER 可能看起来不错,但它会掩盖实体转录中的重大错误,使转录稿对于生产语音代理毫无用处。他们建议在真实的、混乱的音频数据上测量 MER,而不是在干净的录音室录音上,以准确预测性能。
-
Whisper语音识别模型适配多语言医疗用途
研究人员分析了多语言医疗适配如何影响Whisper模型的内部表征。该研究比较了不同Whisper模型尺寸的各种微调策略,发现微调显著提高了MedASR的性能。在特定的诊断场景下,Whisper-Medium实现了最低的英语词错误率(WER),而Whisper-Large-v3实现了最低的德语WER。分析表明,英语医疗微调引起了编码器表征最显著的变化,而多语言延续在很大程度上保持了这些适配。
-
AssemblyAI 表示,定制语音识别模型很少能超越通用人工智能
AssemblyAI 认为,定制语音识别模型通常是不必要的,甚至可能不如现代通用模型准确。虽然定制模型曾经是提高专业领域准确性的标准,但目前在海量、多样化数据集上训练的 AI 模型开箱即用,具有高度的鲁棒性和准确性。该公司建议,通常可以在不需要完整定制模型的情况下满足定制词汇需求,但对于儿童语音等高度独特的音频特征,也存在例外情况。
-
AssemblyAI 推出 cpWER 以准确衡量说话人分割准确性
AssemblyAI 推出了一个名为 cpWER(连接最小置换词错误率)的新指标,以更准确地衡量语音转文本系统中说话人分割的性能。与传统的词错误率 (WER) 不同,cpWER 考虑了说话人归属错误,而 WER 忽略了这一点。该公司提供 cpWER 的 Python 实现,并使用 Universal-3.5 Pro 文本的示例展示了其有效性,突出了它如何揭示 DER(分割错误率)可能忽略的重大不准确之处。
-
视觉语言模型在历史文献OCR中表现出细微的幻觉
一篇新的研究论文分析了视觉语言模型(VLM)在转录历史文献方面的性能。研究发现,尽管它们在字符错误率(CER)和单词错误率(WER)等标准指标上优于传统的OCR系统,但它们表现出细微但关键的故障模式。这些模式包括生成虚假内容和进行语义替换,这些替换在不显著影响CER/WER的情况下改变了含义,尤其影响了命名实体。该研究强调,需要采用评估方法来评估语义可靠性,而不仅仅是字符准确性,以满足档案转录的需求。
-
语音克隆增强副语言学任务和跨语言临床语音分析
一篇新的研究论文探讨了使用语音克隆技术对副语言学任务进行数据增强,特别是在标记数据稀缺的临床应用中。该研究对八种语音克隆模型进行了基准测试,发现大多数模型仅有轻微退化地保留了副语言学信号。此外,将英语临床语音克隆成日语后发现,在克隆数据上训练可以提高对真实日语语音中抑郁和焦虑的检测能力,这表明语音克隆在增强低资源临床语音数据方面具有潜力。
-
语音克隆模型为临床语音任务保留副语言学信号
研究人员评估了八种语音克隆模型,以确定它们在语音任务中保留副语言学信号的有效性,特别是在标记数据稀缺的临床环境中。研究发现,大多数模型仅有轻微的信号退化。此外,将英语临床语音克隆成日语的实验表明,与直接跨语言迁移相比,使用克隆数据进行训练可以提高日语使用者抑郁和焦虑的检测率,这表明语音克隆在增强低资源语言临床语音数据方面具有潜力。
-
AssemblyAI 详解超越词错误率 (WER) 的高级语音识别评估方法
AssemblyAI 发布了一份指南,详细介绍了评估语音转文本模型的先进方法,超越了传统的词错误率 (WER)。文章强调了 WER 的局限性,例如它无法考虑语义含义或真实转录中的错误,并介绍了语义 WER 和漏检实体率等指标。该公司以其最新的 Universal-3.5 Pro 模型为例,指出其在众多数据集上的平均英语 WER 为 5.6%。
-
Whisper模型微调以实现鲁棒的阿萨姆语语音识别
研究人员开发了一个微调版本的Whisper模型,以改进阿萨姆语的自动语音识别(ASR)。该微调模型在Mozilla Common Voice 24.0-Assamese语料库上进行训练,并使用Tesla 4 GPU针对资源受限环境进行了优化,其性能显著优于零样本基线。新系统在词错误率(WER)、字符错误率(CER)、匹配错误率(MER)和词信息丢失(WIL)方面实现了大幅降低,同时在语义评估的BLEU和METEOR分数方面也有显著提高。
-
AssemblyAI 详解生产级语音代理的最佳实践
AssemblyAI 发布了一系列博文,详细介绍了构建生产级语音代理的最佳实践。文章强调了强大的遥测和诊断管道的重要性,以便在用户发现问题之前捕获回归,并提倡使用现有日志和 AssemblyAI 的工具来实现自助服务。关键技术讨论涵盖了通过同步 HTTP 请求优化语音到文本转录的延迟,特别是当开发人员自行管理轮次检测时,并强调“首次响应时间”是感知代理响应能力的关键指标。
-
新的 RLHF 框架改进了越南语历史手稿翻译
研究人员开发了一种新的多模态人类反馈强化学习 (RLHF) 框架,用于将历史汉喃手稿翻译成现代越南语。该方法利用手稿图像的视觉信息和对齐的汉喃文本来提高翻译质量,解决了页面退化和并行数据有限等挑战。该框架集成了多个语言模型和视觉编码器,实验表明,在 BLEU-4 和 BERTScore 等各项指标上,直接偏好优化 (DPO) 的表现优于近端策略优化 (PPO) 和卡方优化 (KTO),证明了偏好优化在低资源历史翻译中的有效性。
-
新的 GRPO 方法提升合成语音 ASR 性能
研究人员开发了一种名为 Group Relative Policy Optimization (GRPO) 的新方法,以改进自动语音识别 (ASR) 模型,特别是在使用合成语音进行训练时。这种强化学习方法在降低词错误率 (WER) 方面显著优于传统的监督微调 (SFT)。GRPO 相较于 SFT 实现了 40% 的相对 WER 降低,而 SFT-然后-GRPO 的组合方法进一步将性能提高了 45%。这些提升归因于 GRPO 增强停止校…
-
Qwen-ASR-1.7B适配多语种双人语音识别 · 跟踪2个来源
研究人员为MLC-SLM 2026挑战赛开发了一个系统,该系统将Qwen3-ASR-1.7B模型适配于多语种、双人对话语音。该系统将说话人日志前端与适配后的ASR模型集成,处理语音活动、说话人嵌入和音频分割。适配技术包括监督微调、使用合成语音的LoRA微调以及GRPO强化学习,这些技术共同将开发集上的词错误率降低了6.83个百分点,并在评估集上达到了17.97 tcpMER。
-
新流程增强ASR鲁棒性,词错误率降低55%
研究人员开发了一种新颖的双门诊断流程,以增强自动语音识别(ASR)系统在对抗性和良性扰动下的鲁棒性。该流程包含一个双面原子审计和一个基于排名的竞赛,旨在认证令牌存在和对抗性排除,从而提高声学安全性。在四种架构上的评估显示,词错误率(WER)相对降低高达55%,并且置信度得分与WER之间的相关性降低。